DeepSeek V4: O modelo que não precisa vencer para mudar o jogo

Um ano após seu “momento Sputnik”, DeepSeek acabou de lançar algo muito mais difícil de ignorar do que uma manchete de benchmark.

Em 24 de abril de 2026 — exatamente um ano depois que os modelos V3/R1 do DeepSeek sacudiram os mercados globais de IA — o laboratório chinês publicou versões preview de dois novos modelos open-weight: V4-Pro e V4-Flash. O timing é deliberado. A mensagem é clara. E para os desenvolvedores que estão avaliando sua stack de IA em 2026, as implicações merecem atenção.


O Que Chegou ao Mercado

Ambos os modelos são arquiteturas Mixture-of-Experts. V4-Pro carrega 1,6 trilhão de parâmetros totais com 49 bilhões ativos por token — tornando-o, por contagem de parâmetros, o maior modelo open-weight já publicado, superando Kimi K2.6 (1,1B) e GLM-5.1 (754B). V4-Flash é o irmão mais leve: 284 bilhões totais / 13 bilhões ativos.

Ambos são publicados sob licença MIT. Ambos suportam uma janela de contexto nativa de 1 milhão de tokens. Ambos estão disponíveis no Hugging Face, na API do DeepSeek e em chat.deepseek.com (Expert Mode = V4-Pro, Instant Mode = V4-Flash).

A comunidade começou a fazer forks e quantizar em poucas horas após o lançamento.


A História da Arquitetura: Eficiência Acima da Força Bruta

A real notícia não são os parâmetros — é o que DeepSeek fez com a atenção.

V4 introduz uma Arquitetura de Atenção Híbrida que combina dois mecanismos: Compressed Sparse Attention (CSA), que mantém um cache KV compacto mais um seletor esparso top-k, e Heavily Compressed Attention (HCA), que condensa muitos tokens em uma única entrada. A alternância entre ambos é o que torna a janela de 1M tokens operacionalmente viável e não apenas teoricamente disponível.

Os números são concretos: com contexto de 1M tokens, V4-Pro requer apenas 27% dos FLOPs de inferência do DeepSeek V3.2 e apenas 10% do seu cache KV. V4-Flash desce ainda mais: 10% de FLOPs e 7% de cache KV.

Para os desenvolvedores, isso se traduz diretamente. Carregar um repositório grande completo como um único prompt — algo que com modelos anteriores era caro e frequentemente incoerente — se torna um fluxo de trabalho realista. As melhorias de coerência em sessões de contexto longo não são marketing; são uma consequência arquitetural.

V4 também introduz Manifold-Constrained Hyper-Connections (mHC), uma técnica que fortalece as conexões residuais para melhorar a estabilidade da propagação de sinal através das múltiplas camadas do modelo sem sacrificar expressividade.


Onde os Benchmarks Chegam

V4-Pro-Max (modo de máximo esforço de raciocínio) registra uma pontuação de 93,5 em LiveCodeBench — novo máximo para modelos open-weight — e uma classificação de Codeforces de aproximadamente 3.206, que DeepSeek situa em torno da posição 23 entre participantes humanos em competições. No raciocínio formal Putnam-2025, alcança um perfeito 120/120.

O posicionamento honesto: V4-Pro-Max supera GPT-5.2 e Gemini-3.0-Pro em benchmarks de raciocínio padrão. Fica marginalmente atrás de GPT-5.4 e Gemini-3.1-Pro — de acordo com a própria caracterização do DeepSeek, o modelo está aproximadamente 3 a 6 meses atrás dos modelos frontier de última geração em termos de desenvolvimento.

Vale a pena nomear essa lacuna. E também o que custa fechá-la.


O Argumento de Preços É a Verdadeira História

Aqui é onde o panorama estratégico se torna impossível de ignorar.

V4-Flash: USD 0,14/milhão de tokens de entrada, USD 0,28/milhão de saída. V4-Pro: USD 1,74/milhão de entrada, USD 3,48/milhão de saída.

Simon Willison, cujas comparações de preços de modelos são entre as mais citadas na indústria, aponta que V4-Flash é o modelo mais barato do tier de modelos pequenos atual — abaixo até do GPT-5.4 Nano da OpenAI. V4-Pro é o mais barato entre os modelos de classe frontier maiores, com uma margem significativa sobre os equivalentes de OpenAI e Anthropic.

DeepSeek atribui isso a ganhos reais de eficiência arquitetural, não a preços subsidiados. Embora valha esclarecer que a empresa reconheceu restrições de throughput no lançamento por “limitações de computação de alta gama” e sinalizou que os preços poderiam cair ainda mais quando 950 novos supernós Huawei Ascend entrarem em operação no final de 2026.

Este não é um modelo que compete por liderar cada leaderboard. É um modelo com um preço tal que o custo de não avaliá-lo é significativo.


O Que Isso Significa Se Você Está Construindo

Para consumidores de API: O tier V4-Flash é o primeiro que vale a pena fazer benchmark. Com USD 0,14/M de entrada, é acessível para aplicações de alto volume onde o custo foi o fator limitante para usar modelos de classe frontier. Para fluxos de trabalho de agentes complexos que requerem raciocínio profundo, V4-Pro-Max é o ponto de comparação natural contra equivalentes closed-source.

Para fluxos de trabalho de contexto longo: A janela de 1M tokens não é nova em 2026 — mas a história de eficiência é. Carregar um repositório grande, um conjunto completo de documentação ou uma conversa extensa de múltiplas sessões sem degradação de coerência nem custos de inferência proibitivos é agora uma consideração prática, não teórica.

Para quem quer fazer hospedagem local: O reality check importa. V4-Pro, com aproximadamente 865 GB em disco em precisão mista FP4/FP8, requer no mínimo oito GPUs H100 80 GB com NVLink para um deployment realista — isso é território de data center. V4-Flash com 160 GB é outra história: uma versão quantizada poderia rodar em um MacBook Pro M5 de 128 GB, e o time do Unsloth começou a publicar variantes quantizadas em poucas horas após o lançamento.

Uma dimensão que não desaparece: A soberania de dados. Os prompts enviados para a API hosteada do DeepSeek transitam por infraestrutura chinesa. Para times onde a residência de dados importa, as alternativas são: hospedagem local (soberania total, custo de hardware real) ou usar um provedor de API de terceiros como OpenRouter, que serve os mesmos pesos a partir de infraestrutura nos EUA ou Europa.


A Pergunta Estrutural Que Vale a Pena Fazer

O verdadeiro feito do DeepSeek não é derrotar GPT-5.4 em um leaderboard. É demonstrar, pelo segundo ano consecutivo, que as curvas de custo da IA frontier podem ser quebradas mais rápido do que os modelos de pricing dos incumbentes assumem.

Um modelo que entrega 85–90% da capacidade frontier a 10–15% do custo não precisa ganhar a guerra de benchmarks para remodelar as decisões de procurement, as discussões de arquitetura empresarial e a dinâmica competitiva de todos os produtos AI-native construídos sobre essas APIs.

O status open-weight acelera tudo isso. Os forks, as quantizações e os fine-tunes da comunidade que vão aparecer nas próximas semanas vão estender o alcance prático desses modelos muito além do que DeepSeek publica hoje.

Você use V4 ou não, os modelos que seus competidores construírem em cima dele vão valer a pena acompanhar de perto.


DeepSeek-V4-Pro e V4-Flash estão disponíveis como open weights no Hugging Face sob licença MIT e através da API do DeepSeek e chat.deepseek.com.