Quanto custa programar com agentes de IA por mês? Um core dev do Wagtail publicou sua fatura

Um mês com agentes de IA custou 2 bilhões de tokens a Thibaud Colas (Wagtail): $68 no modelo barato e $150 em uma única noite com o errado.

Colas, membro do core team do Wagtail, publicou o detalhamento em 2 de outubro de 2026 como encerramento de um desafio que se impôs: passar todo setembro programando com um único modelo open-weight eficiente, GLM 5.3 Flash. Segundo sua própria régua, o desafio fracassou. O valioso é a fatura, porque mostra para onde realmente vai o dinheiro da programação com agentes.

O que aconteceu durante o mês?

A primeira quinzena saiu conforme o plano. Usou apenas GLM 5.3 Flash, e sua parte do mês custou $68. Para essa parte também reporta cerca de 4 kWh de energia e 365 gramas de CO₂.

A segunda quinzena não saiu assim. 1 bilhão dos 2 bilhões de tokens se foram a modelos distintos do objetivo, por três razões:

  • Uma sessão noturna com o modelo errado. É a cara, e a vemos abaixo.
  • Congestão de provedores. Os provedores de inferência de modelos abertos que o Wagtail usa não têm a capacidade de GPU dos grandes laboratórios. GLM 5.3 Flash ficou notavelmente mais lento, então teve que passar para DeepSeek V4.1 Flash e Qwen 3.8 Flash.
  • P&D. Wagtail está montando um benchmark de modelos sobre tarefas de Wagtail, e isso exige rodar muitos modelos, não um.

Saldo final: 50% dos tokens no modelo objetivo, e cerca de 35 kWh de energia contra uma meta de 10.

Quanto custa a programação de forma descontraída com o modelo errado?

Neste caso, $150 em uma noite. O modelo errado foi GLM 5.3, o modelo completo e não a variante Flash. O post não o nomeia, mas Colas confirmou na discussão do Hacker News. Estava prototipando um servidor MCP experimental para Wagtail, e fez todo esse build em modo de programação descontraída sobre o modelo sem Flash, sem se dar conta.

O resultado: 450 milhões de tokens, $150 e 5 kWh, praticamente de um dia para o outro. No tópico do HN conta que essa única sessão equivaleu a cerca de um quarto do gasto do mês e 150% do orçamento. Atribui o problema a duas coisas: a diferença de preço entre os dois modelos, e um agente que ficou rodando sozinho, em modo “descontraído”, a noite toda, trabalhando muito mais do que a tarefa necessitava.

A brecha de preço se vê a simples vista. Estes são os preços de lista do TensorX por milhão de tokens em 3 de outubro de 2026. TensorX é um dos dois provedores que ele usou.

Modelo Input Leitura de cache Output
GLM 5.3 Flash $0,20 $0,05 $0,50
GLM 5.3 $1,75 $0,44 $4,50

É uma diferença de aproximadamente 9 vezes em cada linha. Em uma sessão longa de um agente, esse multiplicador se aplica a cada token que o agente consome, e um loop sem supervisão consome muitíssimos. (Se você precisa revisar como os tokens são cobrados, explicamos em O que são tokens em IA e por que cobram por eles?.)

A estimativa do próprio Colas é que poderia ter chegado a resultados similares com um custo “provavelmente 5 vezes menor”, sem muito mais esforço. O servidor MCP funciona e tem demo, então o dinheiro não foi jogado fora. Mas rendeu muito menos do que podia.

Qual é a melhor IA para programar sem pagar demais?

Segundo Wagtail, não é um único modelo mas uma divisão do trabalho. Esta é sua recomendação publicada, vigente em outubro de 2026:

  • GLM 5.3 Flash para 95% das tarefas, com o nível de raciocínio em “high” ou “max” no seu harness.
  • GLM 5.3 para os 5% mais exigentes.
  • Conte com trocar de modelo a cada dois ou três meses.

Vários desenvolvedores no tópico do HN descrevem o mesmo padrão do outro lado: usar o modelo forte para escrever um plano detalhado e sem ambiguidades, e deixar que o modelo Flash o execute. Um deles resume assim: GLM 5.3 raciocina de forma mais integral sobre o código, enquanto Flash, com um plano claro, o executa bem por uma fração do preço.

Colas também enumera o que vai mudar em outubro. Escolher o modelo é apenas um de quatro pontos:

  1. Medição local e constante de tokens, energia e gasto.
  2. Um orçamento separado para experimentar, não apenas para o trabalho do dia a dia.
  3. Padrões multiagente com objetivos delimitados: papéis de orquestrador, explorador, implementador e revisor.
  4. Continuar empurrando em direção a modelos e técnicas mais eficientes.

Sua conclusão para o trabalho diário é que se concentrar em um ou dois modelos do tipo flash é perfeitamente viável. Para ele, a maioria do trabalho de inferência deveria rodar nesses modelos, medido em custo ou energia e não em tokens.

Quanto custa um agente de IA por mês e quanto você deveria orçar?

Wagtail recomenda $10 por mês por desenvolvedor para uso pessoal e $100 por mês para uso profissional, conforme publicado em 2 de outubro de 2026. Sua postura é que, escolhendo bem o modelo, esses orçamentos alcançam para sessões de programação com uso intensivo de agentes.

O modelo de faturamento importa tanto quanto o número. Wagtail recomenda faturamento 100% por uso com limites de gasto (spend quotas) em vez de assinaturas. Seu raciocínio: atingir o limite deveria te empurrar para modelos menores ou prompts mais ajustados, com menos contexto e mais cache. Uma assinatura esconde esse sinal.

A mesma página fornece níveis de preço aproximados como referência, baseados no custo por tarefa:

  • $1 por milhão de tokens: modelos flagship, para planejar e para os 5% de tarefas mais complexas.
  • $0,10 por milhão: um modelo médio para a maioria das tarefas.
  • $0,01 por milhão: tarefas ocasionais, sensíveis ao preço.

Como você vê quanto seus agentes realmente gastam?

Colas mede seu consumo com AgentsView. É uma ferramenta local-first com licença MIT que lê os arquivos de sessão que seus agentes de código já escrevem e os converte em um arquivo consultável, com relatórios de tokens e custos. Suporta mais de 60 formatos de agentes, entre eles Claude Code, Codex, Cursor, Gemini CLI, OpenCode e Aider.

Instalação em macOS ou Linux:

curl -fsSL https://agentsview.io/install.sh | bash

```As instalações para Windows, app de desktop, pip e Docker estão no guia de início rápido: agentsview.io/docs/quickstart.

Três comandos que vale a pena conhecer:

```bash
agentsview usage daily          # últimos 30 dias por agente, modelo e projeto
agentsview usage statusline     # o gasto de hoje, para sua barra de status
agentsview capture run -- claude -p "fix the tests"   # consumo exato de uma execução não interativa

O segundo é o que teria detectado a sessão noturna a tempo.

Um aviso, que a própria Wagtail aponta: as contagens de tokens do AgentsView são confiáveis, mas seus custos são orientativos. São calculados com dados públicos de preços da LiteLLM e OpenRouter, que nem sempre correspondem ao que seu provedor cobra. Use-o para detectar anomalias e use a faturação do seu provedor para o valor real.

O que esses números não dizem?

  • É o mês de um único desenvolvedor, não um benchmark. A mistura de trabalho foi desenvolvimento do core do Wagtail, um protótipo MCP e P&D de modelos. A sua será diferente.
  • O preço depende do provedor. O mesmo modelo custa diferente conforme o provedor de inferência, e o comportamento do cache muda muito a fatura. Um comentarista do HN sustenta que comprar DeepSeek e GLM diretamente aos seus criadores sai mais barato do que comprar através da Neuralwatt.
  • As cifras de energia são apenas de GPU. Vêm da Neuralwatt, um dos provedores do Wagtail, que mede a energia por solicitação. Pelo menos um comentarista do HN questiona sua metodologia.
  • O benchmark de modelos que aparece no post é um trabalho em curso do Wagtail. Nele, DeepSeek V4.1 Flash lidera com 95% de precisão e $0,09 por tarefa. São dados autorreportados e ainda não publicados completamente.

O útil desta história não depende de nenhuma dessas cifras. Com faturação por uso, o seletor de modelo é um controle de orçamento. O erro caro não veio de escolher um modelo ruim, mas de deixar um padrão equivocado rodando sem supervisão.


E você? Sabe quanto seus agentes de IA gastaram no mês passado e em qual modelo foi a maior parte?

Como você escolhe o modelo para cada tarefa?
  • Uso sempre o mesmo modelo
  • Planejamento com um grande e execução com um barato
  • Mudo de modelo conforme o orçamento do mês vai
  • Prefiro outra opção (conte-nos qual)
0 votantes

Comente abaixo ou, se este artigo chegou a você por email, responda diretamente ao email: sua resposta é publicada aqui.

Relacionado: Netlify testou 11 modelos com o mesmo prompt e publicou os créditos que cada execução consumiu