Netlify testou 11 modelos com o mesmo prompt: e publicou os créditos que cada execução consumiu

Netlify testou 11 modelos com o mesmo prompt: uma execução de Opus 5 consome o plano gratuito inteiro

Netlify publicou em 12 de agosto um experimento que quase ninguém faz em público: executou o mesmo prompt de build três vezes com 11 modelos distintos em seus Agent Runners, mediu os créditos que cada execução consumiu e deixou os 33 sites gerados online para que qualquer pessoa os abra.

O prompt, textualmente:

“Build a one-page site for a neighbourhood coffee shop: opening hours, the address, a short menu and a photo. Nothing on it changes unless I edit it myself.”

Uma landing de cafeteria. Sem banco de dados, sem autenticação, sem build step estranho. A tarefa mais chata que você conseguir imaginar.

O intervalo de consumo foi de 2,4 a 519 créditos. Um fator de ~216× para produzir a mesma página.

A tabela, e o que Netlify não converteu em dinheiro

O post publica créditos. A documentação de faturamento da Netlify publica a taxa de conversão: 1 USD = 180 créditos. Ninguém junta as duas coisas, então aqui está a tabela com a coluna que faltava.

Modelo Execução 1 Execução 2 Execução 3 Média ≈ USD por execução
Claude Opus 5 253 249 1.055 519 $2,88
Claude Sonnet 5 81 245 103 143 $0,79
GPT 5.6 Sol (low effort) 173 158 92 141 $0,78
Gemini 3.6 Flash 109 91 111 103 $0,57
Kimi K3 125 95 86 102 $0,57
Gemini 3.1 Pro 57 52 49 53 $0,29
GPT 5.6 Terra 43 23 49 39 $0,22
DeepSeek V4 Pro 47 30 33 37 $0,21
GLM 5.2 15 42 24 27 $0,15
Kimi K2.7 Code 21 18 17 19 $0,11
DeepSeek V4 Flash 0731 3,4 1,3 2,5 2,4 $0,013

E agora o número que converte isso de curiosidade em decisão: o plano Free da Netlify traz 300 créditos por mês.

A execução média de Opus 5 é 519. Não é que Opus consuma uma parte importante do seu mês gratuito: é que uma única execução não cabe. Nem sequer a mais barata das três de Opus neste teste — 249 créditos — te deixa espaço para tentar uma segunda vez. No plano Personal (1.000 créditos) você tem duas execuções de Opus e pronto o mês.

Com DeepSeek V4 Flash, esses mesmos 300 créditos do plano gratuito te dão aproximadamente 125 execuções completas.

Um detalhe de faturamento que vale a pena deixar claro: os 180 créditos por dólar são a taxa em que a Netlify converte o consumo do modelo em créditos, não o preço que você paga por créditos. Os pacotes adicionais saem por $10 a cada 1.500 créditos em Pro e $5 a cada 500 em Personal. Se você está pagando com créditos comprados, essa execução média de Opus sai por $3,46 em Pro e $5,19 em Personal, não $2,88.

A média não é o que você orça

Olha de novo a fila de Opus: 253, 249 e 1.055. Mesmo prompt, mesma tarefa, três execuções. A terceira consumiu 4,2 vezes o que as duas anteriores.

Esse é o achado mais incômodo do experimento e o próprio post o diz: Opus tende a disparar bem acima do seu próprio baseline, sem que isso garanta um resultado melhor. Não há sinal prévio que te avise qual das três execuções você vai pegar.

Não é exclusivo de Opus. Sonnet 5 fez 81 / 245 / 103 — a execução cara custou 3 vezes a barata. GLM 5.2 foi 15 / 42 / 24. A variabilidade está em todo lugar; o que muda é a escala do estrago quando a execução cara é a de um modelo que já arranca caro.

A consequência prática é direta: se você tem um time com orçamento mensal de créditos, dimensioná-lo contra a média vai te deixar curto. O número contra o qual se planeja é o pior caso observado, não a média. Com Opus, isso significa orçar 1.055 créditos por execução e esperar que na maioria das vezes saia mais barato.

Netlify tem uma alavanca direta para isso que vale a pena ativar antes do que depois: o AI Credit Usage Limit, um teto de gasto de inferência para Agent Runners. Quando você o alcança, não iniciam execuções novas e as ativas se interrompem. É o mais próximo de um fusível que há aqui, e em um modelo com spread de 4,2× é exatamente o que você quer ter ativado.

E a qualidade?

Aqui é onde o experimento fica honesto, e também onde você precisa lê-lo com cuidado.

Netlify dá ao Opus 5 o melhor veredicto: o descreve como “delightful, and full of detail in both its visual design… and the custom map at the bottom”. Sonnet 5 fica um degrau abaixo — “still some delightful detail in each of these, just less so (and less content in general)”. GPT 5.6 Sol em modo low effort, diz o post, ganha de Sonnet em intuição de design básico, o que é um dado interessante em si: o modelo top de OpenAI em seu modo mais barato rendeu melhor que o modelo mid de Anthropic, e por praticamente o mesmo consumo (141 vs 143 créditos).

Do lado barato há defeitos concretos: DeepSeek V4 Pro entregou uma imagem quebrada, e o post aponta que esse tipo de falha é bem menos provável nos modelos comerciais grandes. Gemini 3.1 Pro leva o veredicto mais seco de todos: “there’s really nothing to see here”. Kimi K3 e K2.7 Code também não brilham.

Mas a conclusão que o próprio Netlify tira não é “pague pelo caro”. É que com os modelos simples você pode trabalhar iterativamente — vários turnos guiando o resultado — em vez de esperar a solução chave na mão de uma única passada que oferece Opus. E com a aritmética acima, você tem margem para muitas iterações: 519 créditos de Opus são umas 216 execuções de DeepSeek V4 Flash.

Os 33 sites estão publicados e navegáveis. Abra-os e faça seu próprio julgamento em vez de herdar o da Netlify — é literalmente para isso que os deixaram online: the-coffee-shop-brief.netlify.app

O que este teste não mede

Três ressalvas, e a primeira a Netlify coloca.

É um teste de design e copy, não de arquitetura. Netlify o diz de modo explícito: “this design-and-copy-focused test”. Uma landing estática não exercita nada do que torna difícil uma aplicação real — estado, integrações, refatores sobre código existente, debugging. O post admite explicitamente que Kimi K3 fica mal representado pelo tipo de prompt, e que para lhe fazer justiça seria preciso um conjunto completamente distinto de prompts pensados para uma web app complexa. Um follow-up com casos mais avançados foi anunciado.

Os créditos de Agent Runners somam dois medidores, não um. Inferência de IA (na taxa por token de cada modelo) mais compute do ambiente de execução, medido em GB-hora. Então os números da tabela não são tokens disfarçados e você não consegue derivar o consumo de tokens desde eles.

E você não consegue verificar a tarifa de Opus 5 na doc pública. A tabela de preços por modelo da Netlify está atualizada em 15 de julho de 2026 e lista claude-opus-4-5 e claude-sonnet-5, mas não claude-opus-5. A conversão geral de 180 créditos por dólar sim está publicada e é a que uso acima; a tarifa por milhão de tokens de Opus 5 especificamente, não.

AXIS: a parte open source

Como bônus, o framework que Netlify usa para avaliar modelos automaticamente — AXIS — está liberado com licença MIT em github.com/netlify/axis, com contribuições de Auth0 e Resend.

A ideia é um Lighthouse para agentes: mede o quão bem funciona um serviço para um agente de IA, pontuando quatro dimensões independentes (Goal Achievement, Environment, Service, Agent). Se instala por npm, você configura um JSON com cenários e agentes, executa axis run e ele deixa o transcript completo do que o agente fez mais um relatório com score em .axis/reports/.

Se o experimento da Netlify te deu vontade de executar o seu com seus próprios prompts — que é o que você deveria fazer antes de decidir com qual modelo seu time trabalha — essa é a ferramenta e você não precisa escrevê-la.


Você já mediu quanto custa a mesma tarefa em dois modelos distintos, ou vai pro modelo grande por default? Conte para a gente nos comentários, especialmente se você pegou uma execução que se disparou como a de 1.055 créditos e o que você fez depois.