Guide · Kosten

Was ein Coding-Agent-Lauf wirklich kostet (und wie du weniger ausgibst)

Der Preis pro Token ist der kleinste Hebel. Entscheidend ist, wie viele Läufe für einen mergbaren PR nötig sind — bestimmt vor allem durch die Story, die Aufgabengröße und wie schnell der Agent Feedback bekommt. Plus die versteckten Rechnungen.

Von Aerunit-Team · Zuletzt aktualisiert

Die Rechnung

Wie Agenten abgerechnet werden

Pro Token zu API-Preisen

Cursor: "Cloud Agents are charged at API pricing for the selected model … a larger context window can increase token usage and costs." [1]

Im Plan enthalten, mit gemeinsamen Limits

OpenAI Codex ist in ChatGPT-Plänen enthalten und teilt sich die Nutzung mit ChatGPT [6]; Cloud-Sessions von Claude Code teilen sich Ratenlimits mit der restlichen Claude-Nutzung deines Kontos. [10]

Plan plus gemessene Nutzung

GitHub Copilot cloud agent "uses GitHub Actions minutes and AI credits." [8]

Egal bei welchem Modell: größere Kontexte kosten mehr. Bei Anthropics API etwa werden Eingabe, Ausgabe und Cache-Lesezugriffe getrennt pro Million Tokens bepreist. [2]

Das Richtige messen

Die eigentliche Einheit: Kosten pro gemergtem PR

Ein billiger Lauf, der verworfen wird, kostet mehr als ein teurer, der gemergt wird. Miss also, was du wirklich willst:

Kosten pro gemergtem PR
cost per merged PR =
  (agent spend + CI spend + review hours × hourly cost)
  ÷ PRs merged

Example (illustrative):
  Story A, vague:  4 runs × $3 + 4 CI runs × $0.40 + 60 min review  → 1 PR
  Story B, sharp:  1 run  × $5 + 1 CI run  × $0.40 + 15 min review  → 1 PR

Die Zahlen sind erfunden, das Muster nicht. Der Lauf von Story B war teurer und insgesamt trotzdem deutlich günstiger — vor allem wegen der Review-Zeile.

Was die Kosten treibt

Die Multiplikatoren

Vage Stories

Jedes Missverständnis bedeutet einen Nachbesserungslauf. Siehe unseren Guide zu Stories für Coding-Agenten.

Aufgaben, die für einen Lauf zu groß sind

Lange Läufe füllen den Kontext, und die Qualität sinkt, je voller er wird.

Langsames Feedback

Der Agent pusht, wartet auf CI, behebt, pusht erneut — jede Schleife kostet Tokens plus CI-Minuten.

Überlappende Parallelarbeit

Zwei Agenten in denselben Dateien bedeuten ungeplante Konfliktlösungsläufe.

Zum Kontextpunkt ist die Claude-Code-Dokumentation deutlich: "Claude's context window fills up fast, and performance degrades as it fills." [4] Mehr dazu, wie man Aufgaben so schreibt, dass sie gleich beim ersten Mal richtig laufen, in unserem Guide zu Stories für Coding-Agenten.

Was funktioniert

Kostenhebel, die wirken

Klare Stories

Akzeptanzkriterien und Nicht-Ziele senken Nachbesserungsläufe stärker als jede Preisänderung.

Kleinere Slices

Eine Story, ein Lauf, ein reviewbarer PR.

Schnelle lokale Checks

Lass den Agenten Probleme finden, bevor er pusht — siehe unseren Guide zu sofortigem Feedback.

Kontext wiederverwenden

Prompt-Caching macht wiederholten Kontext deutlich günstiger: Bei Anthropics API werden Cache-Lesezugriffe zu einem Bruchteil (0,1×) der Basis-Eingabekosten bepreist. [3] Kontext zwischen unabhängigen Aufgaben zu leeren hält Läufe schlank. [4]

Modellgröße passend wählen

Nutze das stärkste Modell, wo Urteilsvermögen zählt, und ein günstigeres für mechanische Änderungen.

Abseits der Rechnung

Die versteckten Rechnungen

CI-Minuten skalieren mit dem Volumen der Agent-PRs. GitHub gibt jedem Konto ein Kontingent an kostenlosen Minuten, und "any usage beyond the included amounts is billed to your account." [7] Zwei Taktiken helfen: Läufe abbrechen, die ein neuerer Push bereits ersetzt hat, und teure Testsuiten nur laufen lassen, wenn ein PR als mergebereit markiert ist.

.github/workflows/ci.yml (excerpt)
on:
  pull_request:
    # 'labeled' is needed so adding the label triggers the run
    types: [opened, synchronize, labeled]

concurrency:
  group: ci-${{ github.ref }}
  cancel-in-progress: true

jobs:
  e2e:
    if: contains(github.event.pull_request.labels.*.name, 'ready-to-merge')

GitHub dokumentiert cancel-in-progress genau dafür. [9] Der mit Abstand größte Posten taucht auf keiner Rechnung auf: Review-Zeit. Sie wächst mit jedem PR — deshalb zählen die oben genannten Hebel mehr als der Preis pro Token.

In unseren eigenen Repositories stieg das Volumen an Agent-PRs innerhalb eines Monats um etwa das 2,4-Fache. Das Abbrechen ersetzter Läufe, das Verschlanken von CI-Jobs und End-to-End- Tests nur bei mergebereiten PRs senkten die CI-Kosten pro PR um etwa 27–30 % — die Monatssumme stieg trotzdem, weil es so viel mehr PRs gab. Budgetiere pro PR, nicht pro Monat.

Teams

Budgetierung für ein Team

Drei Modelle dominieren: vorausbezahlte Guthaben, Abonnements mit Nutzungslimits und Pro-Platz-Pläne. Der Trade-off liegt zwischen Planbarkeit und Verschwendung. Pro-Platz- und Abo-Pläne sind planbar, zahlen aber für ungenutzte Plätze und stoßen im ungünstigsten Moment an ihre Grenzen. Vorausbezahlte Guthaben folgen der tatsächlichen Nutzung. Ein gemeinsamer Team-Pool erlaubt es, dass sich jemand mit fünf Agenten diese Woche von jemandem im Urlaub leihen kann; individuelle Limits schützen vor einem einzelnen außer Kontrolle geratenen Lauf.

Wofür du dich auch entscheidest: budgetiere pro gemergtem PR, nicht pro Platz.
Wo wir ansetzen

Wo Aerunit ansetzt

Aerunit wird genau so abgerechnet, wie dieser Guide es empfiehlt: vorausbezahlte Pay-as-you-go-Guthaben in einem gemeinsamen Pool pro Team, ohne Abonnement. Die Agentenläufe selbst werden von Cursor über dein eigenes Cursor-Konto abgerechnet; Aerunit-Guthaben decken Aerunits Arbeit — Stories schreiben, verteilen und reviewen.

Es wirkt außerdem gegen den größten Multiplikator — Nachbesserungsläufe. Der Story-Writer schlägt Linear-Issues mit Umfang, Akzeptanzkriterien und Nicht-Zielen vor, und das abhängigkeitsbewusste Dispatching startet eine Slice erst, wenn das blockierende Issue gemergt ist, sodass Agenten nicht auf noch nicht existierendem Code aufbauen. Automatisches PR-Review schickt Befunde zurück in die Session des Agenten, bevor du Review-Zeit investierst.

Pay as you go

Vorausbezahlte Guthaben, ein gemeinsamer Pool pro Team, kein Abonnement.

Weniger Nachbesserungsläufe

Klarere Stories und Dispatching in Abhängigkeitsreihenfolge.

Review vor der Ausgabe

Automatisches Review schickt Befunde an den Agenten zurück, bevor deine Review-Zeit anfällt.

Kurz beantwortet

Häufige Fragen

Was kostet ein Coding-Agent pro Monat?

Das variiert stark je nach Tool und Nutzung. Als Datenpunkt: Anthropic berichtet, dass Claude Code in Unternehmenseinsätzen im Schnitt rund 13 US-Dollar pro Entwickler und aktivem Tag bzw. 150–250 US-Dollar pro Entwickler und Monat kostet. Cursor Cloud Agents werden zu API-Preisen des gewählten Modells abgerechnet, die Kosten folgen also den genutzten Tokens. [5] [1]

Ist ein günstigeres Modell immer billiger?

Nein. Wenn ein günstigeres Modell drei Durchläufe braucht, um einen mergbaren PR zu liefern, ein stärkeres aber nur einen, ist das stärkere pro gemergtem PR billiger — und kostet dich zusätzlich weniger Review-Zeit. Wähle das Modell passend zur Aufgabe.

Was ist die größte versteckte Kostenquelle?

Review-Zeit. Sie wächst mit dem PR-Volumen und taucht nie auf einer Rechnung auf. CI-Minuten kommen direkt danach: Sie werden über das im Plan enthaltene Kontingent hinaus abgerechnet, und jeder Agent-Push kann einen Lauf auslösen. [7]

Aerunit

Halte die Agenten beschäftigt. Du übernimmst das Denken.

Aerunit ist im Early Access, nur auf Einladung. Bezahle nur, was du nutzt — keine Abos, die man vergisst, und Teams teilen sich ohne Aufpreis einen Credit-Pool.

Frühen Zugang anfragen