Sí, puedes usar Codex CLI con un modelo local de 125B: Strata v0.1.39 añadió la OpenAI Responses API que Codex necesita, y todo corre en tu propio equipo.
Versiones de esta guía: al momento de publicar esta nota (5 de octubre de 2026), la versión vigente es Strata v0.1.39, publicada el 4 de octubre, y la combinación probada por el proyecto es con Codex CLI 0.160.0. Strata saca versiones casi a diario: revisa las release notes más recientes antes de seguir estos pasos.
Strata es un motor de inferencia open source (MIT) que corre Qwen3.8-Flash-Next en una sola GPU de consumo, y desde esta versión expone POST /v1/responses, el protocolo que Codex usa con proveedores propios. Aquí tienes la configuración exacta y el hardware que de verdad hace falta.
¿Qué es Strata?
Strata es un motor de inferencia hecho para correr un solo modelo, Qwen3.8-Flash-Next (125B parámetros, mixture-of-experts), en una GPU de consumo. No intenta meter el modelo entero en la VRAM; reparte el trabajo:
- GPU: atención, routers, la caché KV y una caché de experts con los más usados. Se adapta mientras trabajas.
- RAM: los 24.576 experts. La CPU calcula los que no están en la GPU, en paralelo con ella.
- SSD: una tabla n-gram de 28,8 GB, de la que lee unas pocas filas por token.
Sirve tres APIs en http://127.0.0.1:8080: OpenAI Chat Completions, Anthropic Messages y, desde v0.1.39, la OpenAI Responses API. Strata es MIT; los pesos del modelo tienen sus propias licencias.
Al instalar eliges una variante:
- Q2_0 (66 GB de descarga): la más rápida.
- IQ2_XS (68 GB): algo mejor en calidad.
- IQ3_XXS (76 GB): la de mejor calidad, la más lenta.
- Coder: una versión podada de experts y calibrada con código y datos de agentes. Sus autores reportan el 91,3% del puntaje en SWE-bench Verified del modelo completo.
- Swift 1.5: un fine-tune que razona con menos tokens.
¿Qué hardware necesitas para correr una IA local de 125B?
Para el modelo completo necesitas 12 GB de VRAM y 64 GB de RAM. Es un caso de PC de escritorio, no de laptop.
| Requisito (documentación de Strata, v0.1.39) | |
|---|---|
| GPU | NVIDIA RTX 20/30/40/50 con 12 GB de VRAM o más (con 8 GB funciona, lento), o tarjetas AMD Radeon compatibles |
| RAM | 64 GB recomendados |
| CPU | x86-64 con AVX2 (con AVX-512 va algo más rápido) |
| Disco | 70–80 GB para el modelo más ~6 GB para la capa de borrador; se recomienda mucho un NVMe |
| SO | Windows 10/11 o Linux |
¿Y con 32 GB de RAM? El modelo completo no entra, pero la variante Coder sí: sus experts ocupan unos 23 GB de RAM. Un PC con 32 GB y una GPU de 24 GB también puede correr Q2_0 e IQ2_XS en el modo de poca RAM, que copia a la RAM solo los experts que la GPU no tiene.
¿Qué tan rápido va? Estas son cifras del propio proyecto, medidas en una sola máquina: RTX 5070 de 12 GB, Ryzen 5 7600, 64 GB DDR5.
- Salida con Q2_0: unos 93 tokens/s con 4K de contexto y unos 74 tokens/s con 128K.
- Lectura del prompt: unos 1.300 tokens/s a 4K. El tiempo hasta el primer token ronda los 4 s a 4K, 25 s a 32K y menos de 2 minutos a 128K.
- Salida con Coder: unos 55 tokens/s a 4K.
- Otras GPU: la documentación da cifras para tarjetas como la RTX 3090, pero las marca como estimaciones (±20%), no como mediciones.
- La regla del proyecto: más VRAM pesa más que una GPU más rápida. Cada GB extra aloja unos 700 experts que la CPU ya no tiene que calcular.
Si la cuenta de VRAM contra parámetros te resulta nueva, la explicamos con otro modelo en Kolibri de Aleph Alpha.
¿Cómo instalar Strata en Windows y Linux?
En Windows, haz doble clic en START-HERE.bat. Solo necesitas un driver de NVIDIA (versión 580 o más reciente). Todo lo demás se instala solo: Python si no lo tienes, las librerías de CUDA y el motor.
La primera vez hace cuatro preguntas:
- ¿Qué modelo?
- ¿Qué tamaño?
- ¿Cuánto contexto?
- ¿Imágenes sí o no?
Después descarga el modelo; si la descarga se corta, sigue donde quedó. Al terminar abre la página de chat en http://127.0.0.1:8080. Los siguientes arranques se saltan la instalación y tardan entre 30 y 90 segundos en cargar los experts en la RAM.
En Linux, ejecuta ./setup.sh. Hace las mismas preguntas y arranca igual.
Variantes útiles:
START-HERE.bat --setup --family coder instala la variante Coder
START-HERE.bat --model IQ2_XS --context 32768 --vision yes --yes sin preguntas
Para actualizar, ejecuta UPDATE.bat, o ./update.sh en Linux.
¿Cómo usar Codex CLI con un modelo local?
Agrega un proveedor propio en ~/.codex/config.toml. En Windows el archivo es %USERPROFILE%\.codex\config.toml. Esta es la configuración de la documentación de Strata:
model = "strata" # any name; Strata answers with its model
model_provider = "strata"
model_context_window = 32768 # the context you chose in setup: Codex compacts before it gets there
show_raw_agent_reasoning = true # show the model's thinking (it writes no summaries)
# model_reasoning_effort = "medium" # none, low, medium or high; default: the model's (high)
[model_providers.strata]
name = "Strata (local)"
base_url = "http://127.0.0.1:8080/v1"
wire_api = "responses"
stream_idle_timeout_ms = 600000 # a first, long prompt can take minutes to read
# env_key = "STRATA_API_KEY" # only if the server has an api_key: the variable holding it
Cuatro detalles importan:
- Tiene que ir en tu configuración de usuario. La referencia de OpenAI indica que Codex ignora
model_providerymodel_providersen el.codex/config.tomlde un proyecto. model_context_windowdebe coincidir con el contexto que elegiste en la instalación de Strata, para que Codex compacte la conversación antes de que Strata la rechace.wire_api = "responses"es el único protocolo que Codex admite para proveedores propios. Por eso Strata necesitaba el nuevo endpoint.- Sube el tiempo de espera. El
stream_idle_timeout_mspor defecto de Codex es 300000 (5 minutos), y un primer prompt largo puede superarlo.
Después ejecuta codex, o codex exec "...", como siempre. El aviso Model metadata for ... not found es esperable con un nombre de modelo local.
En Windows, en la prueba del proyecto, el sandbox de Codex rechazó todos los comandos de shell hasta que Codex se inició con -c 'windows.sandbox="unelevated"'. Es un ajuste de Codex, no de Strata.
Si expones Strata fuera de tu equipo, configura primero una clave: agrega "api_key" a strata-<model>.json y descomenta env_key en la configuración de Codex. Por defecto, el servidor solo escucha en 127.0.0.1.
¿Qué tan rápido es Codex CLI con un modelo local?
El primer turno es lento y los siguientes son rápidos, porque Strata guarda la conversación en caché. En la prueba del proyecto con Codex 0.160.0, usando Q2_0 en la RTX 5070:
- El primer prompt de Codex fueron 9.443 tokens de instrucciones y descripciones de herramientas, leídos en 10 segundos.
- En un ciclo de herramientas, cada turno siguiente reutilizó cerca del 96% del prompt desde la caché y leyó solo la parte nueva, en 1–2 segundos.
Son cifras reportadas por el propio proyecto, en un solo PC.
¿Qué no funciona todavía?
Al momento de publicar, con v0.1.39:
- No guarda estado en el servidor.
previous_response_idno está soportado. Codex no lo necesita, porque reenvía la conversación en cada turno. - No hay herramientas alojadas. Herramientas como
web_searchquedan fuera, porque el modelo no puede ejecutarlas. Las function tools sí funcionan. tool_choiceno puede forzar una herramienta. El modelo siempre elige.- No hay resúmenes de razonamiento. El modelo no los escribe; por eso la configuración activa
show_raw_agent_reasoning. - Una petición a la vez por defecto.
"parallel": Ndecodifica varias conversaciones juntas, pero en una tarjeta de 12 GB cuesta velocidad: con cuatro peticiones, la decodificación bajó a 63,1 tokens/s contra 70,7 con una sola. - El hardware más antiguo o distinto es experimental. Las tarjetas Pascal/Volta, Intel Arc (solo Linux, sin probar en Arc en esta versión) y las CPU sin AVX2 tienen rutas opcionales que escribieron y midieron miembros de la comunidad en sus propias máquinas. El mantenedor no tiene ese hardware.
¿Strata u Ollama para Codex?
Si tu modelo ya corre en Ollama o LM Studio, usa eso: Codex trae proveedores integrados para ambos (--oss, oss_provider). Strata es otra apuesta: existe para correr un modelo concreto de 125B en una sola GPU de consumo, y se conecta a Codex como proveedor propio. Si estás eligiendo entre motores locales, comparamos los tres principales en LM Studio, Ollama o llama.cpp: qué corre de verdad en tu máquina. Y si ya enrutas Codex hacia otros proveedores con un gateway, 9router cubre ese camino.
¿Codex gratis? Lo que cuesta usar Codex CLI con un modelo local
Strata es gratis y tiene licencia MIT. Los pesos de cada modelo tienen la suya: el Coder es Apache-2.0 según su ficha, y Swift 1.5 usa la Swift Open License 1.0. El costo pasa a tu hardware y a tu consumo eléctrico: las peticiones de Codex van a tu propio equipo en lugar de a una API medida.
¿Y tú? ¿Contra qué preferirías correr Codex: un modelo en la nube o uno en tu propio equipo?
- En una API en la nube
- En un modelo local
- En ambos, según la tarea
- Prefiero otra opción (cuéntanos cuál)
Comenta abajo o, si este artículo te llegó por correo, responde directamente al email: tu respuesta se publica aquí.
Relacionado: Claude Code vs Codex: cómo correr los dos con tus propias claves