¿Cuánto cuesta programar con agentes de IA al mes? Un core dev de Wagtail publicó su factura

Un mes con agentes de IA le costó 2.000 millones de tokens a Thibaud Colas (Wagtail): $68 en el modelo barato y $150 en una sola noche con el equivocado.

Colas, miembro del core team de Wagtail, publicó el desglose el 2 de octubre de 2026 como cierre de un reto que se impuso a sí mismo: pasar todo septiembre programando con un solo modelo open-weight eficiente, GLM 5.3 Flash. Según su propia vara, el reto fracasó. Lo valioso es la factura, porque muestra adónde se va realmente el dinero del agentic coding.

¿Qué pasó durante el mes?

La primera quincena salió según el plan. Usó solo GLM 5.3 Flash, y su parte del mes costó $68. Para esa parte también reporta unos 4 kWh de energía y 365 gramos de CO₂.

La segunda quincena no salió así. 1.000 de los 2.000 millones de tokens se fueron a modelos distintos del objetivo, por tres razones:

  • Una sesión nocturna con el modelo equivocado. Es la cara, y la vemos abajo.
  • Congestión de proveedores. Los proveedores de inferencia de modelos abiertos que usa Wagtail no tienen la capacidad de GPU de los grandes laboratorios. GLM 5.3 Flash se volvió notablemente más lento, así que tuvo que pasar a DeepSeek V4.1 Flash y Qwen 3.8 Flash.
  • I+D. Wagtail está armando un benchmark de modelos sobre tareas de Wagtail, y eso exige correr muchos modelos, no uno.

Balance final: 50 % de los tokens en el modelo objetivo, y unos 35 kWh de energía frente a una meta de 10.

¿Cuánto cuesta el vibe coding con el modelo equivocado?

En este caso, $150 en una noche. El modelo equivocado fue GLM 5.3, el modelo completo y no la variante Flash. El post no lo nombra, pero Colas lo confirmó en la discusión de Hacker News. Estaba prototipando un servidor MCP experimental para Wagtail, e hizo todo ese build en modo vibe coding sobre el modelo sin Flash, sin darse cuenta.

El resultado: 450 millones de tokens, $150 y 5 kWh, prácticamente de la noche a la mañana. En el hilo de HN cuenta que esa única sesión equivalió a cerca de un cuarto del gasto del mes y al 150 % del presupuesto. Atribuye el problema a dos cosas: la diferencia de precio entre ambos modelos, y un agente que quedó corriendo solo, en modo “vibe”, toda la noche, trabajando mucho más de lo que la tarea necesitaba.

La brecha de precio se ve a simple vista. Estos son los precios de lista de TensorX por millón de tokens al 3 de octubre de 2026. TensorX es uno de los dos proveedores que él usó.

Modelo Input Lectura de caché Output
GLM 5.3 Flash $0,20 $0,05 $0,50
GLM 5.3 $1,75 $0,44 $4,50

Es una diferencia de aproximadamente 9 veces en cada línea. En una sesión larga de un agente, ese multiplicador se aplica a cada token que el agente consume, y un loop sin supervisión consume muchísimos. (Si necesitas repasar cómo se cobran los tokens, lo explicamos en ¿Qué son los tokens en la IA y por qué te cobran por ellos?.)

La estimación del propio Colas es que podría haber llegado a resultados similares con un costo “probablemente 5 veces menor”, sin mucho más esfuerzo. El servidor MCP funciona y tiene demo, así que el dinero no se tiró. Pero rindió mucho menos de lo que podía.

¿Cuál es la mejor IA para programar sin pagar de más?

Según Wagtail, no es un solo modelo sino una división del trabajo. Esta es su recomendación publicada, vigente a octubre de 2026:

  • GLM 5.3 Flash para el 95 % de las tareas, con el nivel de razonamiento en “high” o “max” en tu harness.
  • GLM 5.3 para el 5 % más exigente.
  • Cuenta con cambiar de modelo cada dos o tres meses.

Varios desarrolladores en el hilo de HN describen el mismo patrón desde el otro lado: usar el modelo fuerte para escribir un plan detallado y sin ambigüedades, y dejar que el modelo Flash lo ejecute. Uno de ellos lo resume así: GLM 5.3 razona de forma más integral sobre el código, mientras que Flash, con un plan claro, lo ejecuta bien por una fracción del precio.

Colas también enumera lo que va a cambiar en octubre. Elegir el modelo es solo uno de cuatro puntos:

  1. Medición local y constante de tokens, energía y gasto.
  2. Un presupuesto separado para experimentar, no solo para el trabajo del día a día.
  3. Patrones multiagente con objetivos acotados: roles de orquestador, explorador, implementador y revisor.
  4. Seguir empujando hacia modelos y técnicas más eficientes.

Su conclusión para el trabajo diario es que concentrarse en uno o dos modelos de tipo flash es perfectamente viable. Para él, la mayoría del trabajo de inferencia debería correr en esos modelos, medido en costo o energía y no en tokens.

¿Cuánto cuesta un agente de IA al mes y cuánto deberías presupuestar?

Wagtail recomienda $10 al mes por desarrollador para uso personal y $100 al mes para uso profesional, según lo publicado el 2 de octubre de 2026. Su postura es que, eligiendo bien el modelo, esos presupuestos alcanzan para sesiones de programación con uso intensivo de agentes.

El modelo de facturación importa tanto como la cifra. Wagtail recomienda facturación 100 % por uso con topes de gasto (spend quotas) en lugar de suscripciones. Su razonamiento: llegar al tope debería empujarte hacia modelos más chicos o prompts más ajustados, con menos contexto y más caché. Una suscripción esconde esa señal.

La misma página da niveles de precio aproximados como referencia, basados en el costo por tarea:

  • $1 por millón de tokens: modelos flagship, para planificar y para el 5 % de tareas más complejas.
  • $0,10 por millón: un modelo mediano para la mayoría de las tareas.
  • $0,01 por millón: tareas ocasionales, sensibles al precio.

¿Cómo ves cuánto gastan realmente tus agentes?

Colas mide su consumo con AgentsView. Es una herramienta local-first con licencia MIT que lee los archivos de sesión que tus agentes de código ya escriben y los convierte en un archivo consultable, con reportes de tokens y costos. Soporta más de 60 formatos de agentes, entre ellos Claude Code, Codex, Cursor, Gemini CLI, OpenCode y Aider.

Instalación en macOS o Linux:

curl -fsSL https://agentsview.io/install.sh | bash

Las instalaciones para Windows, app de escritorio, pip y Docker están en la guía de inicio: Quick Start - AgentsView.

Tres comandos que vale la pena conocer:

agentsview usage daily          # últimos 30 días por agente, modelo y proyecto
agentsview usage statusline     # el gasto de hoy, para tu barra de estado
agentsview capture run -- claude -p "fix the tests"   # consumo exacto de una ejecución no interactiva

El segundo es el que habría detectado la sesión nocturna a tiempo.

Una advertencia, que la propia Wagtail señala: los conteos de tokens de AgentsView son confiables, pero sus costos son orientativos. Se calculan con datos públicos de precios de LiteLLM y OpenRouter, que no siempre coinciden con lo que te cobra tu proveedor. Úsalo para detectar anomalías, y usa la facturación de tu proveedor para la cifra real.

¿Qué no te dicen estos números?

  • Es el mes de un solo desarrollador, no un benchmark. La mezcla de trabajo fue desarrollo del core de Wagtail, un prototipo MCP e I+D de modelos. La tuya será distinta.
  • El precio depende del proveedor. El mismo modelo cuesta distinto según el proveedor de inferencia, y el comportamiento del caché cambia mucho la factura. Un comentarista de HN sostiene que comprar DeepSeek y GLM directamente a sus creadores sale más barato que comprarlos a través de Neuralwatt.
  • Las cifras de energía son solo de GPU. Vienen de Neuralwatt, uno de los proveedores de Wagtail, que mide la energía por solicitud. Al menos un comentarista de HN cuestiona su metodología.
  • El benchmark de modelos que aparece en el post es un trabajo en curso de Wagtail. En él, DeepSeek V4.1 Flash lidera con 95 % de precisión y $0,09 por tarea. Son datos autorreportados y todavía no publicados completos.

Lo útil de esta historia no depende de ninguna de esas cifras. Con facturación por uso, el selector de modelo es un control de presupuesto. El error caro no vino de elegir un mal modelo, sino de dejar un default equivocado corriendo sin supervisión.


¿Y tú? ¿Sabes cuánto gastaron tus agentes de IA el mes pasado, y en qué modelo se fue la mayor parte?

¿Cómo eliges el modelo para cada tarea?
  • Uso siempre el mismo modelo
  • Planifico con uno grande y ejecuto con uno barato
  • Cambio de modelo según cómo va el presupuesto del mes
  • Prefiero otra opción (cuéntanos cuál)
0 votantes

Comenta abajo o, si este artículo te llegó por correo, responde directamente al email: tu respuesta se publica aquí.

Relacionado: Netlify probó 11 modelos con el mismo prompt: y publicaron los créditos que consumió cada corrida