Netlify probó 11 modelos con el mismo prompt: y publicaron los créditos que consumió cada corrida

Netlify probó 11 modelos con el mismo prompt: una corrida de Opus 5 se come el plan gratis entero

Netlify publicó el 12 de agosto un experimento que casi nadie hace en público: corrió el mismo prompt de build tres veces con 11 modelos distintos en sus Agent Runners, midió los créditos que consumió cada corrida y dejó los 33 sitios generados online para que cualquiera los abra.

El prompt, textual:

“Build a one-page site for a neighbourhood coffee shop: opening hours, the address, a short menu and a photo. Nothing on it changes unless I edit it myself.”

Una landing de cafetería. Sin base de datos, sin auth, sin build step raro. La tarea más aburrida que se te ocurra.

El rango de consumo fue de 2,4 a 519 créditos. Un factor de ~216× para producir la misma página.

La tabla, y lo que Netlify no tradujo a plata

El post publica créditos. La documentación de facturación de Netlify publica la tasa de conversión: 1 USD = 180 créditos. Nadie junta las dos cosas, así que acá está la tabla con la columna que falta.

Modelo Corrida 1 Corrida 2 Corrida 3 Promedio ≈ USD por corrida
Claude Opus 5 253 249 1.055 519 $2,88
Claude Sonnet 5 81 245 103 143 $0,79
GPT 5.6 Sol (low effort) 173 158 92 141 $0,78
Gemini 3.6 Flash 109 91 111 103 $0,57
Kimi K3 125 95 86 102 $0,57
Gemini 3.1 Pro 57 52 49 53 $0,29
GPT 5.6 Terra 43 23 49 39 $0,22
DeepSeek V4 Pro 47 30 33 37 $0,21
GLM 5.2 15 42 24 27 $0,15
Kimi K2.7 Code 21 18 17 19 $0,11
DeepSeek V4 Flash 0731 3,4 1,3 2,5 2,4 $0,013

Y ahora el número que convierte esto de curiosidad en decisión: el plan Free de Netlify trae 300 créditos por mes.

La corrida promedio de Opus 5 son 519. No es que Opus te consuma una parte importante de tu mes gratis: es que una sola corrida no entra. Ni siquiera la más barata de las tres de Opus en este test — 249 créditos — te deja espacio para intentar una segunda vez. En el plan Personal (1.000 créditos) tienes dos corridas de Opus y se acabó el mes.

Con DeepSeek V4 Flash, esos mismos 300 créditos del plan gratis te dan alrededor de 125 corridas completas.

Un matiz de facturación que conviene tener claro: los 180 créditos por dólar son la tasa a la que Netlify convierte el consumo del modelo en créditos, no el precio al que tú compras créditos. Los packs adicionales van a $10 por 1.500 créditos en Pro y $5 por 500 en Personal. Si estás pagando con créditos comprados, esa corrida promedio de Opus te sale $3,46 en Pro y $5,19 en Personal, no $2,88.

El promedio no es lo que presupuestas

Mira otra vez la fila de Opus: 253, 249 y 1.055. Mismo prompt, misma tarea, tres corridas. La tercera consumió 4,2 veceslo que las dos anteriores.

Ese es el hallazgo más incómodo del experimento y el propio post lo dice: Opus tiende a dispararse muy por encima de su propio baseline, sin que eso garantice un resultado mejor. No hay señal previa que te avise cuál de las tres corridas te va a tocar.

No es exclusivo de Opus. Sonnet 5 hizo 81 / 245 / 103 — la corrida cara costó 3 veces la barata. GLM 5.2 fue 15 / 42 / 24. La variabilidad está en todos lados; lo que cambia es la escala del daño cuando la corrida cara es la de un modelo que ya arranca caro.

La consecuencia práctica es directa: si tienes un equipo con presupuesto mensual de créditos, dimensionarlo contra el promedio te va a dejar corto. El número contra el que se planifica es el peor caso observado, no la media. Con Opus, eso significa presupuestar 1.055 créditos por corrida y esperar que casi siempre te salga más barato.

Netlify tiene una palanca directa para esto que vale la pena activar antes que después: el AI Credit Usage Limit, un tope de gasto de inferencia para Agent Runners. Cuando lo alcanzas, no arrancan corridas nuevas y las activas se detienen. Es lo más parecido a un fusible que hay acá, y en un modelo con spread de 4,2× es exactamente lo que quieres tener puesto.

¿Y la calidad?

Acá es donde el experimento se pone honesto, y también donde hay que leerlo con cuidado.

Netlify le da a Opus 5 el mejor veredicto: lo describe como “delightful, and full of detail in both its visual design… and the custom map at the bottom”. Sonnet 5 queda un escalón abajo — “still some delightful detail in each of these, just less so (and less content in general)”. GPT 5.6 Sol en modo low effort, dice el post, le gana a Sonnet en intuición de diseño básico, lo cual es un dato interesante por sí solo: el modelo top de OpenAI en su modo más barato rindió mejor que el modelo medio de Anthropic, y por prácticamente el mismo consumo (141 vs 143 créditos).

Del lado barato hay defectos concretos: DeepSeek V4 Pro entregó una imagen rota, y el post señala que ese tipo de falla es bastante menos probable en los modelos comerciales grandes. Gemini 3.1 Pro se lleva el veredicto más seco de todos: “there’s really nothing to see here”. Kimi K3 y K2.7 Code tampoco brillan.

Pero la conclusión que el propio Netlify saca no es “paga por el caro”. Es que con los modelos simples puedes trabajar iterativamente — varios turnos guiando el resultado — en lugar de esperar la solución llave en mano de una sola pasada que ofrece Opus. Y con la aritmética de arriba, tienes margen para muchísimas iteraciones: 519 créditos de Opus son unas 216 corridas de DeepSeek V4 Flash.

Los 33 sitios están publicados y navegables. Ábrelos y haz tu propio juicio en vez de heredar el de Netlify — es literalmente para eso que los dejaron online: the-coffee-shop-brief.netlify.app

Lo que este test no mide

Tres salvedades, y la primera la pone el propio post.

Es un test de diseño y copy, no de arquitectura. Netlify lo dice con todas las letras: “this design-and-copy-focused test”. Una landing estática no ejercita nada de lo que hace difícil una aplicación real — estado, integraciones, refactors sobre código existente, debugging. El post admite explícitamente que Kimi K3 queda mal representado por el tipo de prompt, y que para hacerle justicia haría falta un set completamente distinto de prompts pensados para una web app compleja. Hay un follow-up con casos más avanzados anunciado.

Los créditos de Agent Runners suman dos medidores, no uno. Inferencia de IA (en la tasa por token de cada modelo) más compute del entorno de ejecución, medido en GB-hora. Así que los números de la tabla no son tokens disfrazados y no puedes derivar el consumo de tokens desde ellos.

Y no puedes verificar la tarifa de Opus 5 en la doc pública. La tabla de precios por modelo de Netlify está actualizada al 15 de julio de 2026 y lista claude-opus-4-5 y claude-sonnet-5, pero no claude-opus-5. La conversión general de 180 créditos por dólar sí está publicada y es la que uso arriba; la tarifa por millón de tokens de Opus 5 específicamente, no.

AXIS: la parte open source

Como bonus, el framework que Netlify usa para evaluar modelos automáticamente — AXIS — está liberado con licencia MIT en github.com/netlify/axis, con contribuciones de Auth0 y Resend.

La idea es un Lighthouse para agentes: mide qué tan bien funciona un servicio para un agente de IA, puntuando cuatro dimensiones independientes (Goal Achievement, Environment, Service, Agent). Se instala por npm, configuras un JSON con escenarios y agentes, corres axis run y te deja el transcript completo de lo que hizo el agente más un reporte con score en .axis/reports/.

Si el experimento de Netlify te dio ganas de correr el tuyo con tus propios prompts — que es lo que deberías hacer antes de decidir con qué modelo trabaja tu equipo — esa es la herramienta y no tienes que escribirla.


¿Alguna vez mediste cuánto te cuesta la misma tarea en dos modelos distintos, o vas al modelo grande por default?Cuéntanos en los comentarios, sobre todo si te tocó una corrida que se disparó como la de 1.055 créditos y qué hiciste después.