Guide · Coûts

Ce que coûte vraiment une exécution d'agent de codage (et comment dépenser moins)

Le prix par token est le plus petit levier. Ce qui détermine le coût, c'est le nombre d'exécutions nécessaires pour obtenir une PR mergeable — fixé surtout par la story, la taille de la tâche et la rapidité du feedback reçu par l'agent. Sans oublier les factures cachées.

Par Équipe Aerunit · Dernière mise à jour

La facture

Comment les agents sont facturés

Au token, au tarif API

Cursor : "Cloud Agents are charged at API pricing for the selected model … a larger context window can increase token usage and costs." [1]

Inclus dans un forfait, avec des limites partagées

OpenAI Codex est inclus dans les forfaits ChatGPT et partage l'usage avec ChatGPT [6] ; les sessions cloud de Claude Code partagent les limites de débit avec le reste de l'usage Claude de votre compte. [10]

Forfait plus usage mesuré

GitHub Copilot cloud agent "uses GitHub Actions minutes and AI credits." [8]

Quel que soit le modèle, des contextes plus grands coûtent plus cher. Sur l'API d'Anthropic, par exemple, l'entrée, la sortie et les lectures de cache sont tarifées séparément par million de tokens. [2]

Mesurer la bonne chose

La vraie unité : coût par PR mergée

Une exécution bon marché qui est jetée coûte plus cher qu'une exécution onéreuse qui est mergée. Mesurez donc ce que vous voulez réellement :

Coût par PR mergée
cost per merged PR =
  (agent spend + CI spend + review hours × hourly cost)
  ÷ PRs merged

Example (illustrative):
  Story A, vague:  4 runs × $3 + 4 CI runs × $0.40 + 60 min review  → 1 PR
  Story B, sharp:  1 run  × $5 + 1 CI run  × $0.40 + 15 min review  → 1 PR

Les chiffres sont inventés, pas la logique. L'exécution de la story B était plus chère, et pourtant bien plus économique au global — principalement grâce à la ligne relecture.

Ce qui fait grimper la facture

Les multiplicateurs

Stories vagues

Chaque malentendu est une exécution de reprise. Voir notre guide sur les stories pour agents de codage.

Tâches trop grosses pour une seule exécution

Les exécutions longues remplissent le contexte, et la qualité baisse à mesure qu'il se remplit.

Feedback lent

L'agent pousse, attend la CI, corrige, pousse à nouveau — chaque boucle coûte des tokens en plus des minutes CI.

Travail parallèle qui se chevauche

Deux agents sur les mêmes fichiers signifient des exécutions de résolution de conflits que personne n'avait prévues.

Sur le sujet du contexte, la documentation de Claude Code est directe : "Claude's context window fills up fast, and performance degrades as it fills." [4] Pour en savoir plus sur comment écrire un travail qui s'exécute bien du premier coup, voir notre guide sur les stories pour agents de codage.

Ce qui marche

Les leviers de coût qui marchent

Des stories précises

Les critères d'acceptation et les non-objectifs réduisent plus les exécutions de reprise que n'importe quel changement de tarif.

Des découpages plus petits

Une story, une exécution, une PR relisable.

Des vérifications locales rapides

Laissez l'agent détecter les problèmes avant de pousser — voir notre guide sur le feedback instantané.

Réutiliser le contexte

Le prompt caching rend le contexte répété bien moins cher : sur l'API d'Anthropic, les lectures de cache sont facturées à une fraction (0,1×) de l'entrée de base. [3] Vider le contexte entre des tâches sans rapport garde les exécutions légères. [4]

Adapter la taille du modèle

Utilisez le modèle le plus performant là où le jugement compte, et un modèle moins cher pour les changements mécaniques.

Hors facture

Les factures cachées

Les minutes CI augmentent avec le volume de PR des agents. GitHub accorde à chaque compte un quota de minutes gratuites, et "any usage beyond the included amounts is billed to your account." [7] Deux tactiques aident : annuler les exécutions déjà remplacées par un push plus récent, et ne lancer les suites coûteuses que lorsqu'une PR est marquée prête à être mergée.

.github/workflows/ci.yml (excerpt)
on:
  pull_request:
    # 'labeled' is needed so adding the label triggers the run
    types: [opened, synchronize, labeled]

concurrency:
  group: ci-${{ github.ref }}
  cancel-in-progress: true

jobs:
  e2e:
    if: contains(github.event.pull_request.labels.*.name, 'ready-to-merge')

GitHub documente cancel-in-progress exactement pour cela. [9] Le plus gros poste de tous n'apparaît sur aucune facture : le temps de relecture. Il augmente avec chaque PR, c'est pourquoi les leviers ci-dessus comptent plus que le prix par token.

Dans nos propres dépôts, le volume de PR d'agents a augmenté d'environ 2,4× en un mois. Annuler les exécutions remplacées, alléger les jobs CI et ne lancer les tests end-to-end que sur les PR prêtes à être mergées a réduit le coût CI par PR d'environ 27–30 % — mais le total mensuel a quand même augmenté, car il y avait bien plus de PR. Budgétez par PR, pas par mois.

Équipes

Budgéter pour une équipe

Trois modèles dominent : les crédits prépayés, les abonnements avec limites d'usage et les forfaits par siège. Le compromis se joue entre prévisibilité et gaspillage. Les forfaits par siège et les abonnements sont prévisibles mais paient des sièges inactifs et atteignent leurs limites au pire moment. Les crédits prépayés suivent l'usage réel. Un pool d'équipe partagé permet à la personne qui fait tourner cinq agents cette semaine d'emprunter à celle qui est en congé ; des limites par personne protègent contre une exécution incontrôlée.

Quel que soit votre choix, budgétez par PR mergée, pas par siège.
Là où nous intervenons

Où Aerunit intervient

Aerunit est facturé exactement comme ce guide recommande de penser le coût : des crédits prépayés à l'usage dans un seul pool par équipe, sans abonnement. Les exécutions des agents elles-mêmes sont facturées par Cursor sur votre propre compte Cursor ; les crédits Aerunit couvrent le travail d'Aerunit — rédiger les stories, répartir et relire.

Cela agit aussi sur le plus gros multiplicateur — les exécutions de reprise. Le rédacteur de stories propose des issues Linear avec périmètre, critères d'acceptation et non-objectifs, et la répartition consciente des dépendances ne démarre un découpage qu'une fois l'issue bloquante mergée, pour que les agents ne s'appuient pas sur du code qui n'existe pas encore. La relecture automatique des PR renvoie les observations vers la session de l'agent avant que vous n'y passiez du temps de relecture.

Paiement à l'usage

Crédits prépayés, un seul pool par équipe, aucun abonnement.

Moins d'exécutions de reprise

Des stories plus précises et une répartition dans l'ordre des dépendances.

Relecture avant la dépense

La relecture automatique renvoie les observations à l'agent avant que votre temps de relecture n'entre en jeu.

Réponses rapides

Questions fréquentes

Combien coûte un agent de codage par mois ?

Cela varie énormément selon l'outil et l'usage. À titre indicatif, Anthropic rapporte que, dans les déploiements en entreprise, Claude Code coûte en moyenne environ 13 $ par développeur et par jour actif, et 150–250 $ par développeur et par mois. Cursor Cloud Agents est facturé au tarif API du modèle choisi, donc le coût suit les tokens consommés. [5] [1]

Un modèle moins cher est-il toujours plus économique ?

Non. Si un modèle moins cher a besoin de trois essais pour produire une PR mergeable alors qu'un modèle plus performant n'en demande qu'un seul, ce dernier revient moins cher par PR mergée — et il vous fait aussi gagner du temps de relecture. Adaptez le modèle à la tâche.

Quel est le coût caché le plus important ?

Le temps de relecture. Il augmente avec le volume de PR et n'apparaît jamais sur une facture. Les minutes CI viennent juste après : elles sont facturées au-delà du quota inclus dans votre forfait, et chaque push de l'agent peut déclencher une exécution. [7]

Aerunit

Occupez les agents. Gardez la réflexion.

Aerunit est en accès anticipé, sur invitation uniquement. Payez à l'usage — pas d'abonnement oublié, et les équipes partagent une seule réserve de crédits sans surcoût.

Demander un accès anticipé