Guía · Costes

Lo que realmente cuesta una ejecución de un agente de codificación (y cómo gastar menos)

El precio por token es la palanca más pequeña. Lo que determina el coste es cuántas ejecuciones hacen falta para conseguir un PR mergeable — fijado sobre todo por la story, el tamaño de la tarea y la rapidez con la que el agente recibe feedback. Más las facturas ocultas.

Por Equipo de Aerunit · Última actualización

La factura

Cómo se facturan los agentes

Por token a precio de API

Cursor: "Cloud Agents are charged at API pricing for the selected model … a larger context window can increase token usage and costs." [1]

Incluido en un plan, con límites compartidos

OpenAI Codex está incluido en los planes de ChatGPT y comparte uso con ChatGPT [6]; las sesiones en la nube de Claude Code comparten límites de tasa con el resto del uso de Claude en tu cuenta. [10]

Plan más uso medido

GitHub Copilot cloud agent "uses GitHub Actions minutes and AI credits." [8]

Sea cual sea el modelo, los contextos más grandes cuestan más. En la API de Anthropic, por ejemplo, la entrada, la salida y las lecturas de caché se tarifican por separado por cada millón de tokens. [2]

Mide lo correcto

La unidad real: coste por PR mergeado

Una ejecución barata que se descarta cuesta más que una cara que se mergea. Así que mide lo que realmente importa:

Coste por PR mergeado
cost per merged PR =
  (agent spend + CI spend + review hours × hourly cost)
  ÷ PRs merged

Example (illustrative):
  Story A, vague:  4 runs × $3 + 4 CI runs × $0.40 + 60 min review  → 1 PR
  Story B, sharp:  1 run  × $5 + 1 CI run  × $0.40 + 15 min review  → 1 PR

Las cifras son inventadas; la forma no. La ejecución de la story B fue más cara, y aun así sale mucho más barata — sobre todo por la línea de revisión.

Qué dispara el coste

Los multiplicadores

Stories vagas

Cada malentendido es una ejecución de retrabajo. Consulta nuestra guía sobre stories para agentes de codificación.

Tareas demasiado grandes para una sola ejecución

Las ejecuciones largas llenan el contexto, y la calidad baja a medida que se llena.

Feedback lento

El agente hace push, espera a la CI, corrige, vuelve a hacer push — cada vuelta cuesta tokens más minutos de CI.

Trabajo paralelo que se solapa

Dos agentes en los mismos archivos significan ejecuciones de resolución de conflictos que nadie planeó.

Sobre el punto del contexto, la documentación de Claude Code es directa: "Claude's context window fills up fast, and performance degrades as it fills." [4] Más sobre cómo escribir trabajo que se ejecuta bien a la primera en nuestra guía sobre stories para agentes de codificación.

Qué funciona

Palancas de coste que funcionan

Stories precisas

Los criterios de aceptación y los no-objetivos reducen más las ejecuciones de retrabajo que cualquier cambio de precio.

Porciones más pequeñas

Una story, una ejecución, un PR revisable.

Comprobaciones locales rápidas

Deja que el agente encuentre problemas antes de hacer push — consulta nuestra guía sobre feedback instantáneo.

Reutiliza el contexto

El prompt caching hace que el contexto repetido sea mucho más barato: en la API de Anthropic, las lecturas de caché se tarifican a una fracción (0,1×) de la entrada base. [3] Limpiar el contexto entre tareas no relacionadas mantiene las ejecuciones ligeras. [4]

Ajusta el tamaño del modelo

Usa el modelo más potente donde importa el criterio y uno más barato para cambios mecánicos.

Fuera de la factura

Las facturas ocultas

Los minutos de CI escalan con el volumen de PRs de agentes. GitHub da a cada cuenta una cuota de minutos gratuitos, y "any usage beyond the included amounts is billed to your account." [7] Dos tácticas ayudan: cancelar ejecuciones que un push más reciente ya ha reemplazado, y ejecutar las suites caras solo cuando un PR se marca como listo para mergear.

.github/workflows/ci.yml (excerpt)
on:
  pull_request:
    # 'labeled' is needed so adding the label triggers the run
    types: [opened, synchronize, labeled]

concurrency:
  group: ci-${{ github.ref }}
  cancel-in-progress: true

jobs:
  e2e:
    if: contains(github.event.pull_request.labels.*.name, 'ready-to-merge')

GitHub documenta cancel-in-progress exactamente para esto. [9] La partida más grande de todas no aparece en ninguna factura: el tiempo de revisión. Crece con cada PR, por eso las palancas anteriores importan más que el precio por token.

En nuestros propios repositorios, el volumen de PRs de agentes subió alrededor de 2,4× en un mes. Cancelar ejecuciones reemplazadas, recortar jobs de CI y ejecutar las pruebas end-to-end solo en PRs listos para mergear redujo el coste de CI por PR en torno a un 27–30 % — pero el total mensual aun así subió, porque había muchos más PRs. Presupuesta por PR, no por mes.

Equipos

Presupuestar para un equipo

Dominan tres modelos: créditos prepagados, suscripciones con límites de uso y planes por asiento. El compromiso está entre previsibilidad y desperdicio. Los planes por asiento y de suscripción son previsibles pero pagan por asientos inactivos y chocan con los límites en el peor momento. Los créditos prepagados siguen el uso real. Un pool compartido de equipo permite que quien ejecuta cinco agentes esta semana tome prestado de quien está de vacaciones; los límites por persona protegen frente a una ejecución descontrolada.

Elijas lo que elijas, presupuesta por PR mergeado, no por asiento.
Dónde entramos nosotros

Dónde encaja Aerunit

Aerunit se factura tal como recomienda pensar esta guía: con créditos prepagados de pago por uso en un único pool por equipo, sin suscripción. Las ejecuciones de los agentes las factura Cursor en tu propia cuenta de Cursor; los créditos de Aerunit cubren el trabajo de Aerunit — escribir stories, repartir y revisar.

También actúa sobre el mayor multiplicador: las ejecuciones de retrabajo. El escritor de stories propone issues de Linear con alcance, criterios de aceptación y no-objetivos, y el reparto consciente de dependencias solo arranca una porción cuando el issue que la bloquea ya se ha mergeado, así los agentes no construyen sobre código que todavía no existe. La revisión automática de PRs devuelve los hallazgos a la sesión del agente antes de que gastes tiempo de revisión en ello.

Pago por uso

Créditos prepagados, un pool por equipo, sin suscripción.

Menos ejecuciones de retrabajo

Stories más precisas y reparto en orden de dependencias.

Revisión antes de gastar

La revisión automática devuelve hallazgos al agente antes de que entre tu tiempo de revisión.

Respuestas rápidas

Preguntas frecuentes

¿Cuánto cuesta un agente de codificación al mes?

Varía mucho según la herramienta y el uso. Como dato de referencia, Anthropic informa que, en despliegues empresariales, Claude Code cuesta en promedio unos 13 dólares por desarrollador y día activo, y entre 150 y 250 dólares por desarrollador al mes. Cursor Cloud Agents se factura con el precio de API del modelo elegido, así que el coste depende de los tokens usados. [5] [1]

¿Un modelo más barato siempre es más barato?

No. Si un modelo más barato necesita tres ejecuciones para producir un PR mergeable y uno más potente solo necesita una, el más potente sale más barato por PR mergeado — y además te cuesta menos tiempo de revisión. Ajusta el modelo al tamaño de la tarea.

¿Cuál es el coste oculto más grande?

El tiempo de revisión. Crece con el volumen de PRs y nunca aparece en una factura. Los minutos de CI vienen justo después: se facturan por encima de la cuota incluida en tu plan, y cada push del agente puede disparar una ejecución. [7]

Aerunit

Mantén ocupados a los agentes. Tú pones el criterio.

Aerunit está en acceso anticipado solo por invitación. Paga por lo que usas: sin suscripciones que olvidar, y los equipos comparten un fondo de créditos sin coste adicional.

Solicitar acceso anticipado