Magnitude ou llama.cpp? Qual roda mais rápido na sua máquina de acordo com seu hardware

O Magnitude executa modelos locais até 2× mais rápido que o llama.cpp em algumas máquinas e mais lento em outras: quem vence depende do seu chip, não da manchete. O Magnitude é um mecanismo de inferência open source da Magnitude AI Inc. (YC S25), lançado no Hacker News em 30 de setembro. Perfila seu hardware, recomenda os modelos que cabem, ajusta seus kernels de GPU no seu próprio equipamento e se conecta aos agentes que você já usa: Claude Code, OpenCode, Codex, Cline, Hermes ou OpenClaw.

Os números do fabricante são reais, foram publicados e podem ser reproduzidos. Os números independentes que surgiram nas primeiras 24 horas contam uma história mais interessante. Se você executa modelos localmente, leia ambos antes de fazer a mudança.

O que é o Magnitude?

O Magnitude é um servidor de inferência local pensado para cargas de agentes: sessões longas, vários agentes ao mesmo tempo e uma máquina que você continua usando para outras coisas enquanto isso. Está escrito em Rust, com um runtime de kernels de GPU e um autotuner próprios. Tem licença Apache 2.0 e, em 1º de outubro de 2026, o repositório somava 6,1k estrelas e 409 forks.

É distribuído como app de desktop para macOS, Windows e Linux. Você escolhe um modelo no app, clica em Connect ao lado do seu agente, e o Magnitude carrega o modelo quando o agente o pede e o descarrega quando fica inativo ou a memória se enche.

O projeto tem história: o mesmo time construiu antes um agente de navegador open source, e o repositório evoluiu desse produto para a inferência. Segundo os fundadores, eles criaram o Magnitude porque nenhum mecanismo existente funcionava bem para executar agentes localmente.

Como ele sabe qual modelo sua máquina consegue executar?

O Magnitude perfila seu chip, sua memória e sua largura de banda de memória, e estima o ajuste e os tokens por segundo de cada modelo do catálogo antes de você baixar qualquer coisa. Depois os ordena por velocidade, precisão, inteligência e memória. Na visualização Discover do app você parte de uma recomendação “Equilibrada” e move um controle deslizante para velocidade ou para inteligência.

Duas observações dos próprios mantenedores no Hacker News:

  • As estimativas de velocidade são estimativas. Servem para filtrar e ordenar modelos, não incluem o ganho do speculative decoding, e alguns usuários viram números bastante abaixo do que medem na prática. O time diz que está trabalhando para deixar isso mais claro.
  • O ajuste é o que muda o desempenho real. É feito uma única vez para cada modelo que você baixa e, segundo os fundadores, leva cerca de um minuto.

O catálogo só inclui modelos quantizados a 4 bits ou mais. Abaixo disso, segundo o time, o raciocínio, as chamadas de ferramentas e a coerência se degradam muito para trabalhar com agentes.

O Magnitude é realmente 2× mais rápido que o llama.cpp?

No benchmark do próprio fabricante, a velocidade de decode quase dobra em um Mac M4 Pro. Em outro hardware a vantagem varia, e alguns usuários o mediram mais lento que o llama.cpp.

Estos são os números que o Magnitude publicou em seu lançamento. Todos são autorrelatados:

Equipamento Decode Prefill Memória por agente
Mac M4 Pro 48 GB (Metal) 30 → 57 tok/s (+92%) 466 → 507 tok/s (+9%) 28% menos
DGX Spark (CUDA) 49 → 58 tok/s (+19%) 2.033 → 2.507 tok/s (+23%) 27% menos

O teste usou Qwen 3.6 35B A3B a 4 bits, com 64k de contexto e sem speculative decoding. Segundo os fundadores, a tarefa coloca Moby Dick no contexto e pede ao modelo que repita a última seção. O código do benchmark é público no repositório.

Há um detalhe de método que importa. O Magnitude quantiza seu KV cache a 8 bits para as chaves e 4 bits para os valores. O time conta que testou a mesma configuração no llama.cpp e o decode desabou, então o llama.cpp executou com KV cache de 16 bits. Parte da vantagem vem, portanto, dessa quantização e não apenas dos kernels. O time afirma que seus testes de recuperação baseados em RULER não mostram perda de qualidade em contexto longo; essa afirmação também é deles.

No primeiro dia, vários usuários do Hacker News publicaram suas próprias medições:

  • RTX 5070 Ti: llama.cpp foi entre 20% e 30% mais rápido em decode.
  • M5 Max: llama.cpp foi cerca de 2× mais rápido em prefill e decode com Qwen 3.8.
  • M5 Max frente a rapid-mlx (MLX): 175 tok/s de decode frente a 161 do Magnitude, e MLX entregou o primeiro token antes.
  • M5 Pro frente a oMLX: Magnitude foi mais rápido em decode (82,8 frente a 76,5 tok/s), mas cerca de 2,6× mais lento em prefill.

Os mantenedores reconheceram um problema conhecido nos chips M5: seus kernels ainda não aproveitam o hardware de multiplicação de matrizes do Metal 4. Em 1º de outubro de 2026 descreviam o patch como “em andamento”.

A leitura prática: a vantagem do Magnitude é mais clara onde foi ajustado e medido, ou seja, em Apple Silicon da classe M4. Em um M5 ou em algumas placas NVIDIA, meça antes de fazer a mudança.

Magnitude, Ollama, LM Studio ou MLX?

O Magnitude é a opção que escolhe o modelo e ajusta os kernels para você. Ollama e LM Studio priorizam a compatibilidade ampla, e MLX é a rota especializada do Apple Silicon.

O próprio time agrupa os mecanismos existentes em três famílias:

  • Servidores em lote pensados para data centers: vLLM, SGLang.
  • Mecanismos de compatibilidade ampla, que sacrificam velocidade máxima em troca de cobertura: llama.cpp, Ollama.
  • Mecanismos especializados, rápidos em uma plataforma mas menos completos: oMLX e similares.

O Magnitude tenta ajustar kernels genéricos ao seu dispositivo específico.

No Mac, vários comentaristas do Hacker News apontaram que a comparação justa é contra MLX, não contra llama.cpp. O time diz que publicará benchmarks frente a MLX; em 1º de outubro de 2026 ainda não havia feito isso.

Se você está escolhendo seu stack local do zero, comece por nossa comparativa LM Studio, Ollama ou llama.cpp: o que realmente corre na sua máquina. O Magnitude é o novo candidato nessa mesma decisão.

Funciona em Windows, Mac e Linux?

Sim, nos três sistemas. A documentação lista estas configurações:

Equipamento Inferência
Mac com Apple Silicon GPU com Metal
Mac com Intel Apenas CPU
Windows x64 (10 versão 1809 ou posterior, ou 11) CPU, NVIDIA CUDA ou Vulkan
Linux x64 / ARM64 (glibc 2.35 ou posterior) CPU, NVIDIA CUDA ou Vulkan

Quatro limitações que vale a pena conhecer:

  • NVIDIA: as builds de CUDA apontam para GPUs Ampere ou mais recentes; placas anteriores não têm suporte automático.
  • AMD: as GPUs da AMD funcionam com Vulkan; não há backend ROCm.
  • Várias GPUs: até 1º de outubro de 2026 não são suportadas; o time tem isso em seu roadmap próximo.
  • Linux: RHEL 9 fica de fora porque sua glibc é a 2.34, e não há pacotes para Alpine/musl.

O README do GitHub ainda descreve Windows como “apenas via WSL”. A documentação atual descreve um instalador nativo para Windows. Siga a documentação.

Magnitude é gratuito?

Sim. O mecanismo é Apache 2.0, roda completamente na sua máquina e não tem custos por token, chaves de API nem limites de uso. Uma vez baixado o modelo, funciona offline.

No Hacker News, os fundadores descreveram seu modelo de negócio como uma futura nuvem de inferência paga para cargas híbridas. Os modelos locais fariam o que pudessem e uma nuvem cobrada por token resolveria as tarefas mais difíceis, passando de uma para outra sem perder o cache de prefixos. Essa nuvem ainda não existe.

Como instalar Magnitude?

Você baixa o app de desktop em magnitude.dev/download e executa o instalador do seu sistema:

  • macOS: abra o .dmg e arraste Magnitude para Aplicações. Escolha a build de Apple Silicon ou a de Intel.
  • Windows: execute o .exe. Se instala em %LOCALAPPDATA%\Programs\Magnitude.
  • Linux: instale o .deb ou o .rpm da sua distribuição, por exemplo com sudo apt install ./magnitude-desktop.deb ou sudo dnf install ./magnitude-desktop.rpm.

Depois abra Discover, escolha uma recomendação e clique em Download. Os modelos e a configuração são salvos em ~/.magnitude (%USERPROFILE%\.magnitude no Windows), separados do app, então desinstalá-lo não os apaga.

Alguns usuários do Hacker News viram que o passo inicial “Assessing models” ficava travado. O time reconheceu como um bug e continua acompanhando no issue #142 do repositório.

É possível usar Claude Code de graça com modelos locais?

Sim, quanto à inferência: conectado a Magnitude, Claude Code pode usar um modelo que roda na sua máquina, sem pagar tokens. Abra Connections, procure por Claude Code, clique em Connect, escolha um modelo baixado e copie o comando que o card mostra.

Vale a pena saber o que Connect faz por trás:

  • Reescreve sua configuração. Modifica ~/.claude/settings.json para que Claude Code passe pelo gateway de Magnitude.
  • Os modelos locais têm seu próprio prefixo. Seus IDs começam com anthropic-local/, então você inicia Claude Code com claude --model anthropic-local/MODEL_ID. O card de Connections já inclui o ID correto, e no Windows o comando é colado no PowerShell.
  • Também afeta modelos hospedados. Enquanto estiver conectado, até as requisições para modelos na nuvem passam pelo gateway, então Magnitude precisa continuar aberto.
  • Desfaça antes de voltar. Para usar Claude Code normalmente de novo, desconecte-o em Magnitude e reinicie Claude Code.

E com OpenCode, Codex ou outros agentes?

O fluxo é o mesmo para todos: Connections → seu agente → Connect, e depois reinicie o agente e escolha um modelo de Magnitude. Os agentes suportados são Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi e Cline. Já abordamos dois deles em Hermes Agent e em nossa nota sobre OpenClaw (tópico 1915).

Quem deveria testar Magnitude agora?

Teste já se você roda agentes de código localmente em um Mac da classe M4 ou em uma única GPU NVIDIA recente, e prefere não ajustar manualmente os parâmetros de llama.cpp. É lá que foram medidas as cifras do fabricante e onde o profiling que “escolhe o modelo para você” economiza mais tempo.

Espere, ou faça seu próprio benchmark antes, se algum destes casos se aplica a você:

  • você usa um Mac da série M5
  • trabalha com várias GPUs ou com AMD sobre ROCm
  • depende de otimizações específicas de MLX

O time é transparente com essas carências e o mecanismo muda rápido. Baseie sua decisão em seus próprios tok/s, não no título do 2×.