¿Magnitude o llama.cpp? Qué corre más rápido en tu máquina según tu hardware

Magnitude corre modelos locales hasta 2× más rápido que llama.cpp en algunas máquinas y más lento en otras: quién gana depende de tu chip, no del titular. Magnitude es un motor de inferencia open source de Magnitude AI Inc. (YC S25), lanzado en Hacker News el 30 de septiembre. Perfila tu hardware, te recomienda los modelos que caben, ajusta sus kernels de GPU en tu propio equipo y se conecta a los agentes que ya usas: Claude Code, OpenCode, Codex, Cline, Hermes u OpenClaw.

Los números del fabricante son reales, están publicados y se pueden reproducir. Los números independientes que aparecieron en las primeras 24 horas cuentan una historia más interesante. Si corres modelos en local, lee ambos antes de cambiar.

¿Qué es Magnitude?

Magnitude es un servidor de inferencia local (local inference) pensado para cargas de agentes: sesiones largas, varios agentes a la vez y una máquina que sigues usando para otras cosas mientras tanto. Está escrito en Rust, con un runtime de kernels de GPU y un autotuner propios. Tiene licencia Apache 2.0 y, al 1 de octubre de 2026, el repositorio sumaba 6,1k estrellas y 409 forks.

Se distribuye como app de escritorio para macOS, Windows y Linux. Eliges un modelo en la app, pulsas Connect junto a tu agente, y Magnitude carga el modelo cuando el agente lo pide y lo descarga cuando queda inactivo o la memoria se llena.

El proyecto tiene historia: el mismo equipo construyó antes un agente de navegador open source, y el repositorio pasó de ese producto a la inferencia. Según los fundadores, crearon Magnitude porque ningún motor existente servía bien para correr agentes en local.

¿Cómo sabe qué modelo puede correr tu máquina?

Magnitude perfila tu chip, tu memoria y tu ancho de banda de memoria, y estima el encaje y los tokens por segundo de cada modelo del catálogo antes de que descargues nada. Luego los ordena por velocidad, precisión, inteligencia y memoria. En la vista Discover de la app partes de una recomendación “Balanced” y mueves un control deslizante hacia velocidad o hacia inteligencia.

Dos aclaraciones de los propios mantenedores en Hacker News:

  • Las estimaciones de velocidad son estimaciones. Sirven para filtrar y ordenar modelos, no incluyen la ganancia del speculative decoding, y algunos usuarios vieron cifras bastante por debajo de lo que miden en la práctica. El equipo dice que está trabajando para dejarlo más claro.
  • El ajuste es lo que cambia el rendimiento real. Se hace una sola vez por cada modelo que descargas y, según los fundadores, tarda alrededor de un minuto.

El catálogo solo incluye modelos cuantizados a 4 bits o más. Por debajo de eso, según el equipo, el razonamiento, las llamadas a herramientas y la coherencia se degradan demasiado para trabajar con agentes.

¿Magnitude es de verdad 2× más rápido que llama.cpp?

En el benchmark del propio fabricante, la velocidad de decode casi se duplica en un Mac M4 Pro. En otro hardware la ventaja varía, y algunos usuarios lo midieron más lento que llama.cpp.

Estas son las cifras que Magnitude publicó en su lanzamiento. Todas son autorreportadas:

Equipo Decode Prefill Memoria por agente
Mac M4 Pro 48 GB (Metal) 30 → 57 tok/s (+92%) 466 → 507 tok/s (+9%) 28% menos
DGX Spark (CUDA) 49 → 58 tok/s (+19%) 2.033 → 2.507 tok/s (+23%) 27% menos

La prueba usó Qwen 3.6 35B A3B a 4 bits, con 64k de contexto y sin speculative decoding. Según los fundadores, la tarea mete Moby Dick en el contexto y le pide al modelo que repita la última sección. El código del benchmark es público en el repositorio.

Hay un detalle de método que importa. Magnitude cuantiza su KV cache a 8 bits para las claves y 4 bits para los valores. El equipo cuenta que probó la misma configuración en llama.cpp y el decode se desplomó, así que llama.cpp corrió con KV cache de 16 bits. Parte de la ventaja viene, por tanto, de esa cuantización y no solo de los kernels. El equipo afirma que sus pruebas de recuperación basadas en RULER no muestran pérdida de calidad en contexto largo; esa afirmación también es suya.

En el primer día, varios usuarios de Hacker News publicaron sus propias mediciones:

  • RTX 5070 Ti: llama.cpp fue entre un 20% y un 30% más rápido en decode.
  • M5 Max: llama.cpp fue unas 2× más rápido en prefill y decode con Qwen 3.8.
  • M5 Max frente a rapid-mlx (MLX): 175 tok/s de decode frente a 161 de Magnitude, y MLX entregó el primer token antes.
  • M5 Pro frente a oMLX: Magnitude fue más rápido en decode (82,8 frente a 76,5 tok/s), pero unas 2,6× más lento en prefill.

Los mantenedores reconocieron un problema conocido en los chips M5: sus kernels todavía no aprovechan el hardware de multiplicación de matrices de Metal 4. Al 1 de octubre de 2026 describían el parche como “en curso”.

La lectura práctica: la ventaja de Magnitude es más clara donde fue ajustado y medido, es decir, en Apple Silicon de clase M4. En un M5 o en algunas tarjetas NVIDIA, mide antes de cambiar.

¿Magnitude, Ollama, LM Studio o MLX?

Magnitude es la opción que elige el modelo y ajusta los kernels por ti. Ollama y LM Studio priorizan la compatibilidad amplia, y MLX es la ruta especializada de Apple Silicon.

El propio equipo agrupa los motores existentes en tres familias:

  • Servidores por lotes pensados para centros de datos: vLLM, SGLang.
  • Motores de compatibilidad amplia, que sacrifican velocidad máxima a cambio de cobertura: llama.cpp, Ollama.
  • Motores especializados, rápidos en una plataforma pero menos completos: oMLX y similares.

Magnitude intenta ajustar kernels genéricos a tu dispositivo concreto.

En Mac, varios comentaristas de Hacker News señalaron que la comparación justa es contra MLX, no contra llama.cpp. El equipo dice que publicará benchmarks frente a MLX; al 1 de octubre de 2026 todavía no lo había hecho.

Si estás eligiendo tu stack local desde cero, empieza por nuestra comparativa LM Studio, Ollama o llama.cpp: qué corre de verdad en tu máquina. Magnitude es el nuevo candidato en esa misma decisión.

¿Funciona en Windows, Mac y Linux?

Sí, en los tres sistemas. La documentación lista estas configuraciones:

Equipo Inferencia
Mac con Apple Silicon GPU con Metal
Mac con Intel Solo CPU
Windows x64 (10 versión 1809 o posterior, u 11) CPU, NVIDIA CUDA o Vulkan
Linux x64 / ARM64 (glibc 2.35 o posterior) CPU, NVIDIA CUDA o Vulkan

Cuatro límites que conviene conocer:

  • NVIDIA: las builds de CUDA apuntan a GPUs Ampere o más recientes; las tarjetas anteriores no tienen soporte automático.
  • AMD: las GPUs de AMD funcionan con Vulkan; no hay backend ROCm.
  • Varias GPUs: al 1 de octubre de 2026 no están soportadas; el equipo lo tiene en su hoja de ruta cercana.
  • Linux: RHEL 9 queda fuera porque su glibc es la 2.34, y no hay paquetes para Alpine/musl.

El README de GitHub todavía describe Windows como “solo vía WSL”. La documentación actual describe un instalador nativo para Windows. Sigue la documentación.

¿Magnitude es gratis?

Sí. El motor es Apache 2.0, corre por completo en tu máquina y no tiene costes por token, claves de API ni límites de uso. Una vez descargado el modelo, funciona sin conexión.

En Hacker News, los fundadores describieron su modelo de negocio como una futura nube de inferencia de pago para cargas híbridas. Los modelos locales harían lo que puedan y una nube cobrada por token resolvería las tareas más difíciles, pasando de una a otra sin perder la caché de prefijos. Esa nube todavía no existe.

¿Cómo se instala Magnitude?

Descargas la app de escritorio desde magnitude.dev/download y ejecutas el instalador de tu sistema:

  • macOS: abre el .dmg y arrastra Magnitude a Aplicaciones. Elige la build de Apple Silicon o la de Intel.
  • Windows: ejecuta el .exe. Se instala en %LOCALAPPDATA%\Programs\Magnitude.
  • Linux: instala el .deb o el .rpm de tu distribución, por ejemplo con sudo apt install ./magnitude-desktop.deb o sudo dnf install ./magnitude-desktop.rpm.

Después abre Discover, elige una recomendación y pulsa Download. Los modelos y la configuración se guardan en ~/.magnitude (%USERPROFILE%\.magnitude en Windows), separados de la app, así que desinstalarla no los borra.

Algunos usuarios de Hacker News vieron que el paso inicial “Assessing models” se quedaba colgado. El equipo lo reconoció como un bug y lo sigue en el issue #142 del repositorio.

¿Se puede usar Claude Code gratis con modelos locales?

Sí, en cuanto a la inferencia: conectado a Magnitude, Claude Code puede usar un modelo que corre en tu máquina, sin pagar tokens. Abre Connections, busca Claude Code, pulsa Connect, elige un modelo descargado y copia el comando que te muestra la tarjeta.

Conviene saber qué hace Connect por debajo:

  • Reescribe tu configuración. Modifica ~/.claude/settings.json para que Claude Code pase por el gateway de Magnitude.
  • Los modelos locales tienen su propio prefijo. Sus IDs empiezan por anthropic-local/, así que arrancas Claude Code con claude --model anthropic-local/MODEL_ID. La tarjeta de Connections ya incluye el ID correcto, y en Windows el comando se pega en PowerShell.
  • También afecta a los modelos alojados. Mientras esté conectado, incluso las peticiones a modelos en la nube pasan por el gateway, así que Magnitude tiene que seguir abierto.
  • Deshazlo antes de volver. Para usar Claude Code de forma normal otra vez, desconéctalo en Magnitude y reinicia Claude Code.

¿Y con OpenCode, Codex u otros agentes?

El flujo es el mismo para todos: Connections → tu agente → Connect, y después reinicias el agente y eliges un modelo de Magnitude. Los agentes soportados son Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi y Cline. Ya cubrimos dos de ellos en Hermes Agent y en nuestra nota sobre OpenClaw (tema 1915).

¿Quién debería probar Magnitude ahora?

Pruébalo ya si corres agentes de código en local en un Mac de clase M4 o en una sola GPU NVIDIA reciente, y prefieres no ajustar a mano los parámetros de llama.cpp. Ahí es donde se midieron las cifras del fabricante y donde el perfilado que “elige el modelo por ti” ahorra más tiempo.

Espera, o haz tu propio benchmark antes, si te aplica alguno de estos casos:

  • usas un Mac de la serie M5
  • trabajas con varias GPUs o con AMD sobre ROCm
  • dependes de optimizaciones específicas de MLX

El equipo es transparente con estas carencias y el motor cambia rápido. Basa tu decisión en tus propios tok/s, no en el titular del 2×.