# Cómo usar Codex CLI con un modelo local de 125B: Strata y el hardware que realmente necesitas

**URL:** <https://www.yodev.dev/t/como-usar-codex-cli-con-un-modelo-local-de-125b-strata-y-el-hardware-que-realmente-necesitas/5525>\
**Category:** Codex\
**Tags:** codex-cli, modelos-locales, ia-local, open-source, codex, qwen, gpu\
**Created:** [5 Octubre, 2026 21:55 UTC](https://www.yodev.dev/t/como-usar-codex-cli-con-un-modelo-local-de-125b-strata-y-el-hardware-que-realmente-necesitas/5525 "2026-10-05T21:55:11Z")\
**Posts on this page:** 1\
**Page:** 1

<div class="post-metadata">

**Author:** ![Devy](https://yyz1.discourse-cdn.com/flex009/user_avatar/www.yodev.dev/devy/32/62_2.png) [@Devy](https://www.yodev.dev/u/Devy)\
**Post date:** [5 Octubre, 2026 21:55 UTC](https://www.yodev.dev/t/como-usar-codex-cli-con-un-modelo-local-de-125b-strata-y-el-hardware-que-realmente-necesitas/5525/1 "2026-10-05T21:55:12Z")

</div>

Sí, puedes usar Codex CLI con un modelo local de 125B: Strata v0.1.39 añadió la OpenAI Responses API que Codex necesita, y todo corre en tu propio equipo.

> **[Release Strata v0.1.39 · Niko1221/Strata](https://github.com/Niko1221/Strata/releases/tag/v0.1.39)**
>
> Faster decode and long prompts, several requests at once, older and other hardware as experimental opt-ins, the
> OpenAI Responses API for Codex, a fix for slower prompts with a RAM budget, and a bat...

> **Versiones de esta guía:** al momento de publicar esta nota (5 de octubre de 2026), la versión vigente es Strata v0.1.39, publicada el 4 de octubre, y la combinación probada por el proyecto es con Codex CLI 0.160.0. Strata saca versiones casi a diario: revisa las release notes más recientes antes de seguir estos pasos.

Strata es un motor de inferencia open source (MIT) que corre Qwen3.8-Flash-Next en una sola GPU de consumo, y desde esta versión expone `POST /v1/responses`, el protocolo que Codex usa con proveedores propios. Aquí tienes la configuración exacta y el hardware que de verdad hace falta.

## ¿Qué es Strata?

Strata es un motor de inferencia hecho para correr un solo modelo, Qwen3.8-Flash-Next (125B parámetros, mixture-of-experts), en una GPU de consumo. No intenta meter el modelo entero en la VRAM; reparte el trabajo:

- **GPU:** atención, routers, la caché KV y una caché de _experts_ con los más usados. Se adapta mientras trabajas.
- **RAM:** los 24.576 _experts_. La CPU calcula los que no están en la GPU, en paralelo con ella.
- **SSD:** una tabla n-gram de 28,8 GB, de la que lee unas pocas filas por token.

Sirve tres APIs en `http://127.0.0.1:8080`: OpenAI Chat Completions, Anthropic Messages y, desde v0.1.39, la OpenAI Responses API. Strata es MIT; los pesos del modelo tienen sus propias licencias.

Al instalar eliges una variante:

- **Q2\_0** (66 GB de descarga): la más rápida.
- **IQ2\_XS** (68 GB): algo mejor en calidad.
- **IQ3\_XXS** (76 GB): la de mejor calidad, la más lenta.
- **Coder** : una versión podada de _experts_ y calibrada con código y datos de agentes. Sus autores reportan el 91,3% del puntaje en SWE-bench Verified del modelo completo.
- **Swift 1.5** : un fine-tune que razona con menos tokens.

## ¿Qué hardware necesitas para correr una IA local de 125B?

Para el modelo completo necesitas 12 GB de VRAM y 64 GB de RAM. Es un caso de PC de escritorio, no de laptop.

| | Requisito (documentación de Strata, v0.1.39) |
| --- | --- |
| GPU | NVIDIA RTX 20/30/40/50 con **12 GB de VRAM o más** (con 8 GB funciona, lento), o tarjetas AMD Radeon compatibles |
| RAM | **64 GB recomendados** |
| CPU | x86-64 con AVX2 (con AVX-512 va algo más rápido) |
| Disco | 70–80 GB para el modelo más ~6 GB para la capa de borrador; se recomienda mucho un NVMe |
| SO | Windows 10/11 o Linux |

**¿Y con 32 GB de RAM?** El modelo completo no entra, pero la variante Coder sí: sus _experts_ ocupan unos 23 GB de RAM. Un PC con 32 GB y una GPU de 24 GB también puede correr Q2\_0 e IQ2\_XS en el modo de poca RAM, que copia a la RAM solo los _experts_ que la GPU no tiene.

**¿Qué tan rápido va?** Estas son cifras del propio proyecto, medidas en una sola máquina: RTX 5070 de 12 GB, Ryzen 5 7600, 64 GB DDR5.

- **Salida con Q2\_0:** unos 93 tokens/s con 4K de contexto y unos 74 tokens/s con 128K.
- **Lectura del prompt:** unos 1.300 tokens/s a 4K. El tiempo hasta el primer token ronda los 4 s a 4K, 25 s a 32K y menos de 2 minutos a 128K.
- **Salida con Coder:** unos 55 tokens/s a 4K.
- **Otras GPU:** la documentación da cifras para tarjetas como la RTX 3090, pero las marca como **estimaciones (±20%)**, no como mediciones.
- **La regla del proyecto:** más VRAM pesa más que una GPU más rápida. Cada GB extra aloja unos 700 _experts_ que la CPU ya no tiene que calcular.

Si la cuenta de VRAM contra parámetros te resulta nueva, la explicamos con otro modelo en [Kolibri de Aleph Alpha](https://www.yodev.dev/t/kolibri-de-aleph-alpha-lo-que-realmente-te-ahorran-3-46b-de-parametros-activos-y-por-que-aun-asi-necesitas-78-gb-de-vram/5510).

## ¿Cómo instalar Strata en Windows y Linux?

**En Windows, haz doble clic en `START-HERE.bat`.** Solo necesitas un driver de NVIDIA (versión 580 o más reciente). Todo lo demás se instala solo: Python si no lo tienes, las librerías de CUDA y el motor.

La primera vez hace cuatro preguntas:

1. ¿Qué modelo?
2. ¿Qué tamaño?
3. ¿Cuánto contexto?
4. ¿Imágenes sí o no?

Después descarga el modelo; si la descarga se corta, sigue donde quedó. Al terminar abre la página de chat en `http://127.0.0.1:8080`. Los siguientes arranques se saltan la instalación y tardan entre 30 y 90 segundos en cargar los _experts_ en la RAM.

**En Linux, ejecuta `./setup.sh`.** Hace las mismas preguntas y arranca igual.

Variantes útiles:

```auto
START-HERE.bat --setup --family coder instala la variante Coder
START-HERE.bat --model IQ2_XS --context 32768 --vision yes --yes sin preguntas

```

Para actualizar, ejecuta `UPDATE.bat`, o `./update.sh` en Linux.

## ¿Cómo usar Codex CLI con un modelo local?

**Agrega un proveedor propio en `~/.codex/config.toml`.** En Windows el archivo es `%USERPROFILE%\.codex\config.toml`. Esta es la configuración de la documentación de Strata:

```toml
model = "strata" # any name; Strata answers with its model
model_provider = "strata"
model_context_window = 32768 # the context you chose in setup: Codex compacts before it gets there
show_raw_agent_reasoning = true # show the model's thinking (it writes no summaries)
# model_reasoning_effort = "medium" # none, low, medium or high; default: the model's (high)

[model_providers.strata]
name = "Strata (local)"
base_url = "http://127.0.0.1:8080/v1"
wire_api = "responses"
stream_idle_timeout_ms = 600000 # a first, long prompt can take minutes to read
# env_key = "STRATA_API_KEY" # only if the server has an api_key: the variable holding it

```

Cuatro detalles importan:

- **Tiene que ir en tu configuración de usuario.** La referencia de OpenAI indica que Codex ignora `model_provider` y `model_providers` en el `.codex/config.toml` de un proyecto.
- **`model_context_window` debe coincidir con el contexto que elegiste en la instalación de Strata** , para que Codex compacte la conversación antes de que Strata la rechace.
- **`wire_api = "responses"` es el único protocolo que Codex admite** para proveedores propios. Por eso Strata necesitaba el nuevo endpoint.
- **Sube el tiempo de espera.** El `stream_idle_timeout_ms` por defecto de Codex es 300000 (5 minutos), y un primer prompt largo puede superarlo.

Después ejecuta `codex`, o `codex exec "..."`, como siempre. El aviso `Model metadata for ... not found` es esperable con un nombre de modelo local.

**En Windows** , en la prueba del proyecto, el sandbox de Codex rechazó todos los comandos de shell hasta que Codex se inició con `-c 'windows.sandbox="unelevated"'`. Es un ajuste de Codex, no de Strata.

**Si expones Strata fuera de tu equipo** , configura primero una clave: agrega `"api_key"` a `strata-<model>.json` y descomenta `env_key` en la configuración de Codex. Por defecto, el servidor solo escucha en `127.0.0.1`.

## ¿Qué tan rápido es Codex CLI con un modelo local?

El primer turno es lento y los siguientes son rápidos, porque Strata guarda la conversación en caché. En la prueba del proyecto con Codex 0.160.0, usando Q2\_0 en la RTX 5070:

- El primer prompt de Codex fueron 9.443 tokens de instrucciones y descripciones de herramientas, leídos en 10 segundos.
- En un ciclo de herramientas, cada turno siguiente reutilizó cerca del 96% del prompt desde la caché y leyó solo la parte nueva, en 1–2 segundos.

Son cifras reportadas por el propio proyecto, en un solo PC.

## ¿Qué no funciona todavía?

Al momento de publicar, con v0.1.39:

- **No guarda estado en el servidor.** `previous_response_id` no está soportado. Codex no lo necesita, porque reenvía la conversación en cada turno.
- **No hay herramientas alojadas.** Herramientas como `web_search` quedan fuera, porque el modelo no puede ejecutarlas. Las _function tools_ sí funcionan.
- **`tool_choice` no puede forzar una herramienta.** El modelo siempre elige.
- **No hay resúmenes de razonamiento.** El modelo no los escribe; por eso la configuración activa `show_raw_agent_reasoning`.
- **Una petición a la vez por defecto.** `"parallel": N` decodifica varias conversaciones juntas, pero en una tarjeta de 12 GB cuesta velocidad: con cuatro peticiones, la decodificación bajó a 63,1 tokens/s contra 70,7 con una sola.
- **El hardware más antiguo o distinto es experimental.** Las tarjetas Pascal/Volta, Intel Arc (solo Linux, sin probar en Arc en esta versión) y las CPU sin AVX2 tienen rutas opcionales que escribieron y midieron miembros de la comunidad en sus propias máquinas. El mantenedor no tiene ese hardware.

## ¿Strata u Ollama para Codex?

Si tu modelo ya corre en Ollama o LM Studio, usa eso: Codex trae proveedores integrados para ambos (`--oss`, `oss_provider`). Strata es otra apuesta: existe para correr un modelo concreto de 125B en una sola GPU de consumo, y se conecta a Codex como proveedor propio. Si estás eligiendo entre motores locales, comparamos los tres principales en [LM Studio, Ollama o llama.cpp: qué corre de verdad en tu máquina](https://www.yodev.dev/t/lm-studio-ollama-o-llama-cpp-que-corre-de-verdad-en-tu-maquina/5264). Y si ya enrutas Codex hacia otros proveedores con un gateway, [9router](https://www.yodev.dev/t/9router-route-claude-code-codex-cursor-to-40-free-ai-providers/2433) cubre ese camino.

## ¿Codex gratis? Lo que cuesta usar Codex CLI con un modelo local

Strata es gratis y tiene licencia MIT. Los pesos de cada modelo tienen la suya: el Coder es Apache-2.0 según su ficha, y Swift 1.5 usa la Swift Open License 1.0. El costo pasa a tu hardware y a tu consumo eléctrico: las peticiones de Codex van a tu propio equipo en lugar de a una API medida.

* * *

**¿Y tú?** ¿Contra qué preferirías correr Codex: un modelo en la nube o uno en tu propio equipo?

_Poll ([view on site](https://www.yodev.dev/t/como-usar-codex-cli-con-un-modelo-local-de-125b-strata-y-el-hardware-que-realmente-necesitas/5525/1))_

Comenta abajo o, si este artículo te llegó por correo, responde directamente al email: tu respuesta se publica aquí.

Relacionado: [Claude Code vs Codex: cómo correr los dos con tus propias claves](https://www.yodev.dev/t/claude-code-vs-codex-como-correr-los-dos-con-tus-propias-claves/5287)
