Gemini 3.7 Flash rinde más que 3.6 y hoy cuesta exactamente lo mismo
Google lanzó Gemini 3.7 Flash el 13 de agosto, tres semanas después de 3.6 Flash. El anuncio lo describe como “our most intelligent workhorse model yet for coding and agents”, y el titular que viajó más rápido fue el precio: $0,75 por 1M de tokens de input y $3,75 por 1M de output — la mitad de lo que costaba 3.6 Flash cuando salió, el 21 de julio.
Ese número es real. La comparación que sugiere, no. Y la diferencia importa si estás por mover una carga de trabajo.
La pricing page dice algo que el anuncio no dice
La página oficial de precios de Google lista a Gemini 3.6 Flash con exactamente las mismas tarifas, palabra por palabra:
$0.75 through December 31, 2026. $1.50 starting January 1, 2027.
Input, output, context caching, batch, flex — cada fila de 3.6 Flash es idéntica a la de 3.7 Flash. La rebaja del 50 % no se aplicó al modelo nuevo. Se aplicó al tier Flash completo.
| Por 1M de tokens | Hasta el 31 dic 2026 | Desde el 1 ene 2027 |
|---|---|---|
| Input (3.6 y 3.7 Flash) | $0,75 | $1,50 |
| Output (3.6 y 3.7 Flash) | $3,75 | $7,50 |
| Context caching | $0,075 | $0,15 |
| Almacenamiento de caché (por hora) | $0,50 | $1,00 |
| Batch input / output | $0,375 / $1,875 | $0,75 / $3,75 |
De ahí salen dos conclusiones, y ninguna está en el post de lanzamiento.
Primera: ya no queda ningún argumento de costo para quedarte en 3.6 Flash. Mismo precio, y 3.7 gana en todas las comparaciones publicadas contra él. Si hoy estás en 3.6, la decisión es puramente esfuerzo de migración y riesgo de regresión — no es presupuesto.
Segunda: $1,50 / $7,50 no es un aumento. Es el precio con el que 3.6 Flash salió hace cuatro semanas. Así que la lectura honesta de este lanzamiento no es “un modelo más barato”. Es un modelo mejor al mismo precio permanente, con una ventana de descuento de cuatro meses y medio pegada encima. Si tu modelo de costos para el año que viene asume $0,75, estás presupuestando contra una promoción, no contra un precio.
Eso es lo que convierte esto de noticia en decisión de arquitectura. Cualquier carga de trabajo que muevas a Flash entre hoy y diciembre está dimensionada contra un número que se duplica en una fecha que Google ya publicó.
Los benchmarks, y cuáles se movieron de verdad
Todas estas son cifras publicadas por Google. Contra 3.6 Flash:
| Benchmark | 3.7 Flash | 3.6 Flash | Delta |
|---|---|---|---|
| FrontierCode 1.1 Main | 43,6 % | 34,4 % | +9,2 |
| DeepSWE v1.1 | 65,3 % | 49,0 % | +16,3 |
| AutomationBench | 30,4 % | 17,0 % | +13,4 |
| GDP.PDF (comprensión experta de PDF) | 34,0 % | 22,0 % | +12,0 |
| WebDev Arena (Elo) | 1588 | 1538 | +50 |
El salto en tareas de automatización repetitiva (AutomationBench, casi el doble) y en tareas de agente de software engineering (DeepSWE, +16 puntos) es donde la generación efectivamente cambió. La ganancia de Elo en WebDev Arena es el movimiento más pequeño del conjunto y el que más probablemente desaparezca dentro del ruido de tus propios prompts.
Ahora lee la misma tabla en contra del vendor. Google publicó columnas de competencia, y Flash no las barre. (Estas cifras comparativas vienen del chart de benchmarks del lanzamiento, reproducido por prensa técnica; el gráfico original de Google es una imagen.)
| Benchmark | 3.7 Flash | GPT-5.6 Terra | Claude Sonnet 5 |
|---|---|---|---|
| WebDev Arena (Elo) | 1588 | 1523 | 1541 |
| FrontierCode 1.1 Main | 43,6 % | 41,3 % | 42,7 % |
| AutomationBench | 30,4 % | 23,6 % | 10,7 % |
| DeepSWE v1.1 | 65,3 % | 69,6 % | 54,0 % |
| Terminal-bench 2.1 | 85,8 % | 87,4 % | — |
| Terminal-bench 3.0 | 14,9 % | 20,8 % | 14,6 % |
| OSWorld-2.0 | 38,1 % | 50,2 % | — |
| Agent’s Last Exam | 26,3 % | — | 33,3 % |
| Artificial Analysis Intelligence Index | 56 | 57 | 55 |
La forma es consistente: 3.7 Flash lidera en generación de código web y en automatización repetitiva de alto volumen, y queda atrás de los modelos frontier en las tareas agénticas largas y difíciles — Terminal-bench, OSWorld, Agent’s Last Exam. “Workhorse” es la palabra correcta, y es un elogio, no una salvedad. Este es el modelo al que le apuntas las diez mil tareas rutinarias, no al que le apuntas la única tarea que nadie resolvió.
Vale decirlo con todas las letras: son números autoreportados, de un chart publicado el mismo día del lanzamiento. Todavía no existe ninguna evaluación independiente de terceros.
Migrar desde 3.6 Flash
Los dos modelos son GA (stable), no preview. El model string es gemini-3.7-flash. Las notas de migración de Google para la generación 3.x traen algunos ítems que rompen requests, no que apenas los degradan:
Quita los parámetros de sampling. temperature, top_p, top_k y candidate_count están deprecados en toda esta generación. La guía de Google es explícita en que mover temperature de su valor por defecto de 1.0 puede provocar loops o salidas degradadas en trabajo con mucho razonamiento. Si tu configuración de la era 3.5 todavía los define, elimínalos en vez de portarlos.
Reemplaza thinking_budget por thinking_level. Es un enum de strings: low, medium, high. No puedes enviar los dos parámetros en un mismo request. En 3.7 Flash el default es medium.
Ese default es además tu primera palanca de costo, y es fácil pasarla por alto. Los thinking tokens se facturan como output tokens — a $3,75 hoy, $7,50 en enero. Una carga de trabajo que anda bien en low y que está corriendo en medium sin que nadie lo note está pagando esa diferencia en cada llamada. Mídelo antes de asumir que el default te sirve: corre una muestra representativa de tus prompts reales en low y en medium, compara tanto la calidad como el conteo de output tokens reportado, y elige desde los números y no desde la etiqueta.
Las conversaciones multi-turn cambiaron de forma. Los turnos de modelo prellenados quedaron afuera; usa el previous_interaction_id del lado del servidor. Cada objeto FunctionResponse ahora tiene que llevar call_id y name. Los assets multimodales van dentro de los response payloads. Si vienes de 3.5 o anterior, aplican también las reglas de preservación de thought signatures.
Especificaciones para dimensionar: ventana de contexto de 1M de tokens, hasta 64k tokens de output. Google no publicó knowledge cutoff para este modelo.
Una aclaración sobre lo que hice y lo que no: estos ítems de migración salen de la documentación publicada por Google, no de una migración que yo haya ejecutado. Verifica cada uno contra tus propios request payloads antes de mandar a producción.
Las tres palancas antes de enero
Si la carga de trabajo va a ir a Flash de todos modos, hay tres multiplicadores disponibles, y se componen entre sí:
Batch mode — 50 % menos. El input baja a $0,375 y el output a $1,875. Todo lo que no necesita respuesta sincrónica (generación de tests nocturna, documentación en bulk, triage de backlog, etiquetado de datasets) va aquí. Es la palanca más grande y la que más se ignora.
Context caching — 10 veces más barato en la porción cacheada. $0,075 por 1M contra $0,75. Si cada llamada manda el mismo system prompt, el mismo schema o el mismo contexto de repositorio, ese prefijo se está pagando a tarifa completa en cada request. El almacenamiento cuesta $0,50 por 1M de tokens por hora, así que conviene cuando el mismo prefijo se reutiliza lo suficiente dentro de esa hora — haz la cuenta para tu volumen de llamadas en vez de encenderlo en todos lados.
thinking_level: low donde la tarea no necesita profundidad de razonamiento, como decíamos arriba.
Batch más caching, aplicados a una carga que se preste para los dos, mueven el precio efectivo más lejos que la promoción — y a diferencia de la promoción, no vencen.
Qué planificar de verdad
El 31 de diciembre no es un detalle de marketing. Es el número sobre el que debería estar construido tu modelo de costos.
La versión práctica: dimensiona tu arquitectura a $1,50 / $7,50 y trata los próximos cuatro meses y medio como un descuento que estás recibiendo, no como un precio del que dependes. Si la cuenta solo cierra a $0,75, no cierra — construiste una dependencia sobre una ventana promocional con fecha de fin publicada. Si cierra a $1,50, entonces la promoción es upside, y tienes hasta enero para mover a batch y a caching todo lo que califique.
La otra mitad de ese plan es portabilidad. Tres semanas separaron a 3.6 Flash de 3.7 Flash. Sea cual sea la cadencia que está corriendo Google, el modelo detrás de tu endpoint va a volver a cambiar antes de que termine la promoción, y muy posiblemente el tier de precio con él. Mantener el model string en configuración y no en código, y mantener un set de evaluación pequeño que puedas volver a correr contra un modelo nuevo en una tarde, es lo que convierte cada uno de estos lanzamientos de un proyecto de migración en un cambio de config.
¿Ya corriste tus números para enero, o tu modelo de costos sigue apoyado en los $0,75? Cuéntanos en los comentarios — sobre todo si mediste qué le hace thinking_level: low a la calidad en tu propia carga de trabajo, porque esa es la palanca con menos datos públicos detrás.