Comment les agents sont facturés
Au token, au tarif API
Cursor : "Cloud Agents are charged at API pricing for the selected model … a larger context window can increase token usage and costs." [1]
Forfait plus usage mesuré
GitHub Copilot cloud agent "uses GitHub Actions minutes and AI credits." [8]
Quel que soit le modèle, des contextes plus grands coûtent plus cher. Sur l'API d'Anthropic, par exemple, l'entrée, la sortie et les lectures de cache sont tarifées séparément par million de tokens. [2]
La vraie unité : coût par PR mergée
Une exécution bon marché qui est jetée coûte plus cher qu'une exécution onéreuse qui est mergée. Mesurez donc ce que vous voulez réellement :
cost per merged PR =
(agent spend + CI spend + review hours × hourly cost)
÷ PRs merged
Example (illustrative):
Story A, vague: 4 runs × $3 + 4 CI runs × $0.40 + 60 min review → 1 PR
Story B, sharp: 1 run × $5 + 1 CI run × $0.40 + 15 min review → 1 PRLes chiffres sont inventés, pas la logique. L'exécution de la story B était plus chère, et pourtant bien plus économique au global — principalement grâce à la ligne relecture.
Les multiplicateurs
Stories vagues
Chaque malentendu est une exécution de reprise. Voir notre guide sur les stories pour agents de codage.
Tâches trop grosses pour une seule exécution
Les exécutions longues remplissent le contexte, et la qualité baisse à mesure qu'il se remplit.
Feedback lent
L'agent pousse, attend la CI, corrige, pousse à nouveau — chaque boucle coûte des tokens en plus des minutes CI.
Travail parallèle qui se chevauche
Deux agents sur les mêmes fichiers signifient des exécutions de résolution de conflits que personne n'avait prévues.
Sur le sujet du contexte, la documentation de Claude Code est directe : "Claude's context window fills up fast, and performance degrades as it fills." [4] Pour en savoir plus sur comment écrire un travail qui s'exécute bien du premier coup, voir notre guide sur les stories pour agents de codage.
Les leviers de coût qui marchent
Des stories précises
Les critères d'acceptation et les non-objectifs réduisent plus les exécutions de reprise que n'importe quel changement de tarif.
Des découpages plus petits
Une story, une exécution, une PR relisable.
Des vérifications locales rapides
Laissez l'agent détecter les problèmes avant de pousser — voir notre guide sur le feedback instantané.
Adapter la taille du modèle
Utilisez le modèle le plus performant là où le jugement compte, et un modèle moins cher pour les changements mécaniques.
Budgéter pour une équipe
Trois modèles dominent : les crédits prépayés, les abonnements avec limites d'usage et les forfaits par siège. Le compromis se joue entre prévisibilité et gaspillage. Les forfaits par siège et les abonnements sont prévisibles mais paient des sièges inactifs et atteignent leurs limites au pire moment. Les crédits prépayés suivent l'usage réel. Un pool d'équipe partagé permet à la personne qui fait tourner cinq agents cette semaine d'emprunter à celle qui est en congé ; des limites par personne protègent contre une exécution incontrôlée.
Quel que soit votre choix, budgétez par PR mergée, pas par siège.
Où Aerunit intervient
Aerunit est facturé exactement comme ce guide recommande de penser le coût : des crédits prépayés à l'usage dans un seul pool par équipe, sans abonnement. Les exécutions des agents elles-mêmes sont facturées par Cursor sur votre propre compte Cursor ; les crédits Aerunit couvrent le travail d'Aerunit — rédiger les stories, répartir et relire.
Cela agit aussi sur le plus gros multiplicateur — les exécutions de reprise. Le rédacteur de stories propose des issues Linear avec périmètre, critères d'acceptation et non-objectifs, et la répartition consciente des dépendances ne démarre un découpage qu'une fois l'issue bloquante mergée, pour que les agents ne s'appuient pas sur du code qui n'existe pas encore. La relecture automatique des PR renvoie les observations vers la session de l'agent avant que vous n'y passiez du temps de relecture.
Paiement à l'usage
Crédits prépayés, un seul pool par équipe, aucun abonnement.
Moins d'exécutions de reprise
Des stories plus précises et une répartition dans l'ordre des dépendances.
Relecture avant la dépense
La relecture automatique renvoie les observations à l'agent avant que votre temps de relecture n'entre en jeu.
Questions fréquentes
Combien coûte un agent de codage par mois ?
Cela varie énormément selon l'outil et l'usage. À titre indicatif, Anthropic rapporte que, dans les déploiements en entreprise, Claude Code coûte en moyenne environ 13 $ par développeur et par jour actif, et 150–250 $ par développeur et par mois. Cursor Cloud Agents est facturé au tarif API du modèle choisi, donc le coût suit les tokens consommés. [5] [1]
Un modèle moins cher est-il toujours plus économique ?
Non. Si un modèle moins cher a besoin de trois essais pour produire une PR mergeable alors qu'un modèle plus performant n'en demande qu'un seul, ce dernier revient moins cher par PR mergée — et il vous fait aussi gagner du temps de relecture. Adaptez le modèle à la tâche.
Quel est le coût caché le plus important ?
Le temps de relecture. Il augmente avec le volume de PR et n'apparaît jamais sur une facture. Les minutes CI viennent juste après : elles sont facturées au-delà du quota inclus dans votre forfait, et chaque push de l'agent peut déclencher une exécution. [7]
Sources
- [1]Cursor Docs — Cloud Agents (billing)
- [2]Anthropic — API pricing
- [3]Anthropic — Prompt caching
- [4]Claude Code Docs — Best practices
- [5]Claude Code Docs — Manage costs
- [6]OpenAI Developers — Codex pricing
- [7]GitHub Docs — GitHub Actions billing
- [8]GitHub Docs — About Copilot cloud agent
- [9]GitHub Docs — Control workflow concurrency
- [10]Claude Code Docs — Claude Code on the web (limitations)