Como usar Codex CLI com um modelo local de 125B: Strata e o hardware que você realmente precisa

Sim, você pode usar o Codex CLI com um modelo local de 125B: o Strata v0.1.39 adicionou a OpenAI Responses API de que o Codex precisa, e tudo roda na sua própria máquina.

Versões deste guia: no momento da publicação (5 de outubro de 2026), a versão vigente é o Strata v0.1.39, publicado em 4 de outubro, e a combinação testada pelo projeto é com o Codex CLI 0.160.0. O Strata lança versões quase diariamente: confira as release notes mais recentes antes de seguir estes passos.

O Strata é um motor de inferência open source (MIT) que roda o Qwen3.8-Flash-Next em uma única GPU de consumo e, desde esta versão, expõe POST /v1/responses, o protocolo que o Codex usa com provedores personalizados. Aqui estão a configuração exata e o hardware que realmente é necessário.

O que é o Strata?

O Strata é um motor de inferência feito para rodar um único modelo, o Qwen3.8-Flash-Next (125B parâmetros, mixture-of-experts), em uma GPU de consumo. Ele não tenta colocar o modelo inteiro na VRAM; ele divide o trabalho:

  • GPU: atenção, routers, o cache KV e um cache de experts com os mais usados. Ele se adapta enquanto você trabalha.
  • RAM: os 24.576 experts. A CPU calcula os que não estão na GPU, em paralelo com ela.
  • SSD: uma tabela n-gram de 28,8 GB, da qual lê poucas linhas por token.

Ele serve três APIs em http://127.0.0.1:8080: OpenAI Chat Completions, Anthropic Messages e, desde a v0.1.39, a OpenAI Responses API. O Strata é MIT; os pesos do modelo têm licenças próprias.

Na instalação você escolhe uma variante:

  • Q2_0 (download de 66 GB): a mais rápida.
  • IQ2_XS (68 GB): um pouco melhor em qualidade.
  • IQ3_XXS (76 GB): a de melhor qualidade, a mais lenta.
  • Coder: uma versão com experts podados, calibrada com código e dados de agentes. Seus autores relatam 91,3% da pontuação do modelo completo no SWE-bench Verified.
  • Swift 1.5: um fine-tune que raciocina com menos tokens.

Que hardware você precisa para rodar uma IA local de 125B?

Para o modelo completo você precisa de 12 GB de VRAM e 64 GB de RAM. É um caso de PC de mesa, não de notebook.

Requisito (documentação do Strata, v0.1.39)
GPU NVIDIA RTX 20/30/40/50 com 12 GB de VRAM ou mais (com 8 GB funciona, devagar), ou placas AMD Radeon compatíveis
RAM 64 GB recomendados
CPU x86-64 com AVX2 (com AVX-512 fica um pouco mais rápido)
Disco 70–80 GB para o modelo mais ~6 GB para a camada de rascunho; NVMe fortemente recomendado
SO Windows 10/11 ou Linux

E com 32 GB de RAM? O modelo completo não cabe, mas a variante Coder sim: seus experts ocupam cerca de 23 GB de RAM. Um PC com 32 GB e uma GPU de 24 GB também pode rodar Q2_0 e IQ2_XS no modo de pouca RAM, que copia para a RAM apenas os experts que a GPU não tem.

Qual é a velocidade? Estes são números do próprio projeto, medidos em uma única máquina: RTX 5070 de 12 GB, Ryzen 5 7600, 64 GB DDR5.

  • Saída com Q2_0: cerca de 93 tokens/s com 4K de contexto e cerca de 74 tokens/s com 128K.
  • Leitura do prompt: cerca de 1.300 tokens/s a 4K. O tempo até o primeiro token fica em torno de 4 s a 4K, 25 s a 32K e menos de 2 minutos a 128K.
  • Saída com Coder: cerca de 55 tokens/s a 4K.
  • Outras GPUs: a documentação traz números para placas como a RTX 3090, mas os marca como estimativas (±20%), não como medições.
  • A regra do projeto: mais VRAM pesa mais que uma GPU mais rápida. Cada GB extra comporta cerca de 700 experts que a CPU não precisa mais calcular.

Se a conta de VRAM versus parâmetros é nova para você, explicamos com outro modelo em Kolibri de Aleph Alpha.

Como instalar o Strata no Windows e no Linux?

No Windows, dê um duplo clique em START-HERE.bat. Você só precisa de um driver NVIDIA (versão 580 ou mais recente). Todo o resto se instala sozinho: o Python se você não tiver, as bibliotecas CUDA e o motor.

Na primeira vez, ele faz quatro perguntas:

  1. Qual modelo?
  2. Qual tamanho?
  3. Quanto contexto?
  4. Imagens sim ou não?

Depois baixa o modelo; se o download for interrompido, ele continua de onde parou. Ao terminar, abre a página de chat em http://127.0.0.1:8080. As próximas inicializações pulam a instalação e levam de 30 a 90 segundos para carregar os experts na RAM.

No Linux, execute ./setup.sh. Ele faz as mesmas perguntas e inicia da mesma forma.

Variantes úteis:

START-HERE.bat --setup --family coder                              instala a variante Coder
START-HERE.bat --model IQ2_XS --context 32768 --vision yes --yes   sem perguntas

Para atualizar, execute UPDATE.bat, ou ./update.sh no Linux.

Como usar o Codex CLI com um modelo local?

Adicione um provedor personalizado em ~/.codex/config.toml. No Windows, o arquivo é %USERPROFILE%\.codex\config.toml. Esta é a configuração da documentação do Strata:

model = "strata"                        # any name; Strata answers with its model
model_provider = "strata"
model_context_window = 32768            # the context you chose in setup: Codex compacts before it gets there
show_raw_agent_reasoning = true         # show the model's thinking (it writes no summaries)
# model_reasoning_effort = "medium"     # none, low, medium or high; default: the model's (high)

[model_providers.strata]
name = "Strata (local)"
base_url = "http://127.0.0.1:8080/v1"
wire_api = "responses"
stream_idle_timeout_ms = 600000         # a first, long prompt can take minutes to read
# env_key = "STRATA_API_KEY"            # only if the server has an api_key: the variable holding it

Quatro detalhes importam:

  • Tem que ficar na sua configuração de usuário. A referência da OpenAI indica que o Codex ignora model_provider e model_providers no .codex/config.toml de um projeto.
  • model_context_window deve coincidir com o contexto que você escolheu na instalação do Strata, para que o Codex compacte a conversa antes que o Strata a recuse.
  • wire_api = "responses" é o único protocolo que o Codex aceita para provedores personalizados. Por isso o Strata precisava do novo endpoint.
  • Aumente o tempo de espera. O stream_idle_timeout_ms padrão do Codex é 300000 (5 minutos), e um primeiro prompt longo pode ultrapassá-lo.

Depois execute codex, ou codex exec "...", como sempre. O aviso Model metadata for ... not found é esperado com um nome de modelo local.

No Windows, no teste do projeto, o sandbox do Codex rejeitou todos os comandos de shell até que o Codex fosse iniciado com -c 'windows.sandbox="unelevated"'. É uma configuração do Codex, não do Strata.

Se você expuser o Strata fora da sua máquina, configure antes uma chave: adicione "api_key" a strata-<model>.json e descomente env_key na configuração do Codex. Por padrão, o servidor só escuta em 127.0.0.1.

Qual a velocidade do Codex CLI com um modelo local?

O primeiro turno é lento e os seguintes são rápidos, porque o Strata guarda a conversa em cache. No teste do projeto com o Codex 0.160.0, usando Q2_0 na RTX 5070:

  • O primeiro prompt do Codex teve 9.443 tokens de instruções e descrições de ferramentas, lidos em 10 segundos.
  • Em um ciclo de ferramentas, cada turno seguinte reutilizou cerca de 96% do prompt a partir do cache e leu só a parte nova, em 1–2 segundos.

São números informados pelo próprio projeto, em um único PC.

O que ainda não funciona?

No momento da publicação, com a v0.1.39:

  • Não guarda estado no servidor. previous_response_id não é suportado. O Codex não precisa dele, porque reenvia a conversa a cada turno.
  • Não há ferramentas hospedadas. Ferramentas como web_search ficam de fora, porque o modelo não consegue executá-las. As function tools funcionam.
  • tool_choice não consegue forçar uma ferramenta. O modelo sempre escolhe.
  • Não há resumos de raciocínio. O modelo não os escreve; por isso a configuração ativa show_raw_agent_reasoning.
  • Uma requisição por vez, por padrão. "parallel": N decodifica várias conversas juntas, mas em uma placa de 12 GB isso custa velocidade: com quatro requisições, a decodificação caiu para 63,1 tokens/s contra 70,7 com uma só.
  • O hardware mais antigo ou diferente é experimental. Placas Pascal/Volta, Intel Arc (só Linux, sem teste em Arc nesta versão) e CPUs sem AVX2 têm caminhos opcionais que membros da comunidade escreveram e mediram nas próprias máquinas. O mantenedor não tem esse hardware.

Strata ou Ollama para o Codex?

Se o seu modelo já roda no Ollama ou no LM Studio, use isso: o Codex traz provedores integrados para ambos (--oss, oss_provider). O Strata é outra aposta: existe para rodar um modelo específico de 125B em uma única GPU de consumo, e se conecta ao Codex como provedor personalizado. Se você está escolhendo entre motores locais, comparamos os três principais em LM Studio, Ollama o llama.cpp: qué corre de verdad en tu máquina. E se você já roteia o Codex para outros provedores com um gateway, o 9router cobre esse caminho.

Codex grátis? Quanto custa usar o Codex CLI com um modelo local

O Strata é gratuito e tem licença MIT. Os pesos de cada modelo têm a sua: o Coder é Apache-2.0 segundo sua ficha, e o Swift 1.5 usa a Swift Open License 1.0. O custo passa para o seu hardware e o seu consumo de energia: as requisições do Codex vão para a sua própria máquina em vez de para uma API medida.


E você? Contra o que você preferiria rodar o Codex: um modelo na nuvem ou um na sua própria máquina?

¿Dónde corre hoy tu agente de código?
  • En una API en la nube
  • En un modelo local
  • En ambos, según la tarea
  • Prefiero otra opción (cuéntanos cuál)
0 votantes

Comente abaixo ou, se este artigo chegou até você por e-mail, responda diretamente ao e-mail: sua resposta é publicada aqui.

Relacionado: Claude Code vs Codex: cómo correr los dos con tus propias claves