Gemini 3.5 Flash rende mais que 3.6 e custa exatamente o mesmo hoje

Gemini 3.7 Flash rende mais que 3.6 e hoje custa exatamente o mesmo

Google lançou Gemini 3.7 Flash em 13 de agosto, três semanas depois de 3.6 Flash. O anúncio o descreve como “our most intelligent workhorse model yet for coding and agents”, e a manchete que viajou mais rápido foi o preço: $0,75 por 1M de tokens de entrada e $3,75 por 1M de saída — metade do que custava 3.6 Flash quando saiu, em 21 de julho.

Esse número é real. A comparação que sugere, não. E a diferença importa se você está prestes a mover uma carga de trabalho.

A página de preços diz algo que o anúncio não diz

A página oficial de preços do Google lista Gemini 3.6 Flash com exatamente as mesmas tarifas, palavra por palavra:

$0.75 through December 31, 2026. $1.50 starting January 1, 2027.

Entrada, saída, cache de contexto, batch, flex — cada linha de 3.6 Flash é idêntica à de 3.7 Flash. A redução de 50% não foi aplicada ao modelo novo. Foi aplicada ao tier Flash completo.

Por 1M de tokens Até 31 dez 2026 A partir de 1 jan 2027
Entrada (3.6 e 3.7 Flash) $0,75 $1,50
Saída (3.6 e 3.7 Flash) $3,75 $7,50
Cache de contexto $0,075 $0,15
Armazenamento de cache (por hora) $0,50 $1,00
Entrada / saída em batch $0,375 / $1,875 $0,75 / $3,75

Daí saem duas conclusões, e nenhuma está no post de lançamento.

Primeira: não sobra nenhum argumento de custo para ficar em 3.6 Flash. Mesmo preço, e 3.7 vence em todas as comparações publicadas contra ele. Se você está em 3.6 hoje, a decisão é puramente esforço de migração e risco de regressão — não é orçamento.

Segunda: $1,50 / $7,50 não é um aumento. É o preço com o qual 3.6 Flash saiu quatro semanas atrás. Então a leitura honesta deste lançamento não é “um modelo mais barato”. É um modelo melhor pelo mesmo preço permanente, com uma janela de desconto de quatro meses e meio colada em cima. Se seu modelo de custos para o ano que vem assume $0,75, você está orçando contra uma promoção, não contra um preço.

Isso é o que converte isso de notícia em decisão de arquitetura. Qualquer carga de trabalho que você mova para Flash entre hoje e dezembro está dimensionada contra um número que dobra em uma data que Google já publicou.

Os benchmarks, e quais se moveram de verdade

Todos esses são números publicados pelo Google. Contra 3.6 Flash:

Benchmark 3.7 Flash 3.6 Flash Delta
FrontierCode 1.1 Main 43,6 % 34,4 % +9,2
DeepSWE v1.1 65,3 % 49,0 % +16,3
AutomationBench 30,4 % 17,0 % +13,4
GDP.PDF (compreensão especializada de PDF) 34,0 % 22,0 % +12,0
WebDev Arena (Elo) 1588 1538 +50

O salto em tarefas de automação repetitiva (AutomationBench, quase o dobro) e em tarefas de agente de engenharia de software (DeepSWE, +16 pontos) é onde a geração efetivamente mudou. O ganho de Elo em WebDev Arena é o movimento mais pequeno do conjunto e o que mais provavelmente desaparece dentro do ruído de seus próprios prompts.

Agora leia a mesma tabela contra o concorrente. Google publicou colunas de competência, e Flash não as domina. (Essas cifras comparativas vêm do gráfico de benchmarks do lançamento, reproduzido pela imprensa técnica; o gráfico original do Google é uma imagem.)

Benchmark 3.7 Flash GPT-5.6 Terra Claude Sonnet 5
WebDev Arena (Elo) 1588 1523 1541
FrontierCode 1.1 Main 43,6 % 41,3 % 42,7 %
AutomationBench 30,4 % 23,6 % 10,7 %
DeepSWE v1.1 65,3 % 69,6 % 54,0 %
Terminal-bench 2.1 85,8 % 87,4 %
Terminal-bench 3.0 14,9 % 20,8 % 14,6 %
OSWorld-2.0 38,1 % 50,2 %
Agent’s Last Exam 26,3 % 33,3 %
Artificial Analysis Intelligence Index 56 57 55

O padrão é consistente: 3.7 Flash lidera em geração de código web e em automação repetitiva de alto volume, e fica atrás dos modelos frontier nas tarefas agênticas longas e difíceis — Terminal-bench, OSWorld, Agent’s Last Exam. “Workhorse” é a palavra certa, e é um elogio, não uma ressalva. Este é o modelo ao qual você aponta as dez mil tarefas rotineiras, não aquele ao qual aponta a única tarefa que ninguém resolveu.

Vale dizer com todas as letras: são números auto-reportados, de um gráfico publicado no mesmo dia do lançamento. Ainda não existe nenhuma avaliação independente de terceiros.

Migrar de 3.6 Flash

Os dois modelos são GA (stable), não preview. A string do modelo é gemini-3.7-flash. As notas de migração do Google para a geração 3.x trazem alguns itens que quebram requisições, não apenas as degradam:

Remova os parâmetros de amostragem. temperature, top_p, top_k e candidate_count estão descontinuados em toda essa geração. O guia do Google é explícito em que mover temperature de seu valor padrão de 1.0 pode provocar loops ou saídas degradadas em trabalho com muito raciocínio. Se sua configuração da era 3.5 ainda os define, elimine-os em vez de portá-los.

Substitua thinking_budget por thinking_level. É um enum de strings: low, medium, high. Você não pode enviar os dois parâmetros em uma mesma requisição. Em 3.7 Flash o padrão é medium.

Esse padrão é também sua primeira alavanca de custo, e é fácil passar por cima dela. Os tokens de thinking são faturados como tokens de saída — a $3,75 hoje, $7,50 em janeiro. Uma carga de trabalho que funciona bem em low e que está rodando em medium sem que ninguém note está pagando essa diferença em cada chamada. Meça isso antes de assumir que o padrão serve para você: rode uma amostra representativa de seus prompts reais em low e em medium, compare tanto a qualidade quanto a contagem de tokens de saída reportada, e escolha a partir dos números e não da etiqueta.

As conversas multi-turn mudaram de forma. Os turnos de modelo pré-preenchidos ficaram para trás; use previous_interaction_id do lado do servidor. Cada objeto FunctionResponse agora precisa levar call_id e name. Os assets multimodais vão dentro dos response payloads. Se você vem de 3.5 ou anterior, também aplicam as regras de preservação de thought signatures.

Especificações para dimensionar: janela de contexto de 1M de tokens, até 64k tokens de saída. Google não publicou knowledge cutoff para esse modelo.

Uma clarificação sobre o que fiz e o que não: esses itens de migração saem da documentação publicada pelo Google, não de uma migração que eu tenha executado. Verifique cada um contra seus próprios request payloads antes de mandar para produção.

As três alavancas antes de janeiro

Se a carga de trabalho vai para Flash de qualquer forma, há três multiplicadores disponíveis, e eles se compõem um ao outro:

Modo batch — 50% menos. A entrada cai para $0,375 e a saída para $1,875. Tudo o que não precisa de resposta síncrona (geração de testes noturnos, documentação em bulk, triage de backlog, rotulagem de datasets) vai aqui. É a alavanca maior e a que mais se ignora.

Cache de contexto — 10 vezes mais barato na porção cacheada. $0,075 por 1M contra $0,75. Se cada chamada envia o mesmo system prompt, o mesmo schema ou o mesmo contexto de repositório, esse prefixo está sendo pago a tarifa completa em cada requisição. O armazenamento custa $0,50 por 1M de tokens por hora, então convém quando o mesmo prefixo se reutiliza o suficiente dentro dessa hora — faça a conta para seu volume de chamadas em vez de ligar isso em todos os lugares.

thinking_level: low onde a tarefa não precisa de profundidade de raciocínio, como dissemos acima.

Batch mais cache, aplicados a uma carga que se preste para os dois, movem o preço efetivo mais longe que a promoção — e diferentemente da promoção, não vencem.

O que realmente planejar

31 de dezembro não é um detalhe de marketing. É o número sobre o qual deveria estar construído seu modelo de custos.

A versão prática: dimensione sua arquitetura para $1,50 / $7,50 e trate os próximos quatro meses e meio como um desconto que você está recebendo, não como um preço do qual você depende. Se a conta só fecha a $0,75, não fecha — você construiu uma dependência sobre uma janela promocional com data de término publicada. Se fecha a $1,50, então a promoção é upside, e você tem até janeiro para mover para batch e para caching tudo que se qualifique.

A outra metade desse plano é portabilidade. Três semanas separaram o Flash 3.6 do Flash 3.7. Seja qual for a cadência que o Google está seguindo, o modelo por trás do seu endpoint vai mudar novamente antes de a promoção terminar, e muito possivelmente o tier de preço também. Manter a string do modelo em configuração e não em código, e manter um conjunto de avaliação pequeno que você possa executar novamente contra um modelo novo em uma tarde, é o que converte cada um desses lançamentos de um projeto de migração em uma mudança de config.


Você já executou seus números para janeiro, ou seu modelo de custos ainda está apoiado nos $0,75? Conte-nos nos comentários — especialmente se você mediu o que thinking_level: low faz para a qualidade em sua própria carga de trabalho, porque essa é a alavanca com menos dados públicos por trás.

1 curtida