Seu runtime não decide qual modelo você pode rodar: quem decide é seu orçamento de memória. LM Studio, Ollama e llama.cpp deixam você iniciar um modelo que depois vai se arrastar. llmfit é um único comando de terminal que lê sua RAM, CPU e GPU reais e ordena todos os modelos conforme o que de verdade roda em sua máquina, em LM Studio, Ollama, llama.cpp, MLX e Docker Model Runner ao mesmo tempo. Está escrito em Rust, tem licença MIT e ronda as 36.000 estrelas no GitHub.
O interessante não é o ranking. É que a ferramenta se recusa a te dar um número sem te dizer de onde saiu esse número.
Por que escolher runtime não responde a pergunta?
Quase todos os conselhos sobre “qual modelo local rodar” começam no lugar errado: perguntam qual runtime você prefere. Mas LM Studio, Ollama e llama.cpp carregam os mesmos pesos quantizados na mesma memória finita. O que decide se um modelo de 14B é utilizável no seu laptop é quanto de memória precisam os pesos mais o cache KV no contexto que você realmente quer usar — e essa aritmética é idêntica seja qual for o runtime que você levante.
llmfit pontua cada modelo em quatro dimensões em vez de uma: ajuste de memória, velocidade estimada, qualidade e contexto. Um modelo pode passar no filtro de memória e mesmo assim ser a escolha errada, porque só entra com um contexto tão curto que você não consegue colar um arquivo. Separar os eixos é o que faz com que a saída valha a pena ser lida: “entra” e “é utilizável” são afirmações distintas.
A velocidade é o eixo que normalmente se despacha com a mão. Aqui as estimativas saem de um modelo de largura de banda de memória apoiado em amostragem do runtime e em medições reais da comunidade, e — essa é a parte que importa — cada estimativa vem com seus insumos. llmfit info "<modelo>" mostra o análise de ajuste, a base da estimativa e os comandos para verificá-la você mesmo.
Se te interessa até onde se pode esticar uma máquina modesta, em yoDEV já cobrimos como Colibri roda um modelo de 744B parâmetros em um laptop de 32GB sem GPU. llmfit é a ferramenta que te diz de antemão se seu caso se parece com esse.
LM Studio ou Ollama? O que llmfit encontra em cada runtime
Aqui a comparação entre runtimes deixa de ser abstrata. llmfit não te pergunta qual você usa: procura por ele.
- Ollama — consulta
GET /api/tagsao iniciar para inventariar o que você já tem instalado e marca esses modelos com um check verde. Os downloads vão porPOST /api/pull. - LM Studio — consulta
GET /v1/modelsno endpoint padrão; os downloads usamPOST /api/v1/models/download, com progresso rastreado por ID de trabalho. - llama.cpp — se detecta encontrando
llama-clioullama-serverno seu PATH. Os modelos se mapeiam para repositórios GGUF no Hugging Face, com cache local em~/.cache/llmfit/models. - Docker Model Runner — consulta
GET /engines, com nomenclatura estilo Ollamaai/<tag>. - MLX — Apple Silicon, contra o cache de modelos de mlx-community.
Quando mais de um runtime pode servir o mesmo modelo, pressione d na TUI para escolher entre eles. A versão v1.1.10 (17 de agosto de 2026) também adicionou a descoberta de RamaLama.
Os runtimes que rodam em outra máquina se conectam por variáveis de ambiente:
OLLAMA_HOST="http://192.168.1.100:11434" llmfit
DOCKER_MODEL_RUNNER_HOST="http://192.168.1.100:12434" llmfit
LMSTUDIO_HOST="http://192.168.1.100:1234" llmfit
A autenticação da API do LM Studio usa LMSTUDIO_API_KEY.
Como se instala llmfit?
Escolha a linha que corresponda à sua máquina:
scoop install llmfit # Windows
brew install llmfit # macOS/Linux, homebrew-core
port install llmfit # MacPorts
curl -fsSL https://llmfit.axjns.dev/install.sh | sh # adicione -s -- --local para evitar sudo
uvx llmfit # executar sem instalar
docker run --rm -it ghcr.io/alexsjones/llmfit --tui
Executar llmfit sem argumentos abre a TUI: seu hardware acima e todos os modelos ordenados abaixo. / busca, j/k navegam, d baixa, D abre o gerenciador de downloads e r atualiza depois que você levantar um servidor.
Os números são estimados ou medidos?
Todos os números começam sendo uma estimativa. Você pode substituí-los por uma medição.
Levante um modelo em qualquer runtime detectado e pressione b na TUI: llmfit executa três passadas de inferência reais contra o servidor que está rodando e mede tokens por segundo e tempo até o primeiro token em seu hardware. Os resultados são salvos primeiro localmente. Se ativar o compartilhamento com Space ou s, a ferramenta faz fork do repositório, commita seu resultado e abre um pull request através do device flow do GitHub — e as contribuições mescladas viajam em releases posteriores, substituindo estimativas por dados medidos pela comunidade para todos que têm hardware parecido.
Esse ciclo é a razão pela qual a coluna de velocidade vale algo. Os números de benchmark autorrelatados costumam ser um fabricante falando do seu próprio produto; aqui são máquinas de outras pessoas, atribuídas, com o modelo de estimativa visível ao lado.
Como usar llmfit a partir de um script?
Para quem quer conectar isso a um agente ou a um passo de provisionamento, a CLI é a interface real:
llmfit fit --perfect -n 5 # apenas ajustes perfeitos, top 5
llmfit recommend --json --use-case coding --limit 3
llmfit recommend --force-runtime llamacpp
llmfit plan "Qwen/Qwen3-4B-MLX-4bit" --context 8192 --target-tps 25 --json
llmfit doctor # relatório de detecção de hardware
plan é o subcomando subvalorizado: responde “posso rodar este modelo concreto com este contexto concreto e alcançar essa taxa de tokens?”, e seu JSON inclui os deltas de upgrade, ou seja, o que você teria que mudar para que funcione.
Também é possível descrever uma máquina que você ainda não tem, o que a torna uma ferramenta de compra tanto quanto de diagnóstico:
llmfit --memory=24G --ram=64G --cpu-cores=8 fit
E há uma API REST se você a quer residente:
llmfit serve --host 0.0.0.0 --port 8787
curl "http://localhost:8787/api/v1/models/top?limit=5&min_fit=good&use_case=coding"
O que llmfit não faz?
Ordena modelos; não executa inferência. Você continua precisando de um runtime. A dimensão de qualidade é um critério codificado pelos mantenedores, não um benchmark que você rodou, então trate-a como filtro inicial e não como veredicto. E a lista de provedores cresce release a release: no momento de publicar esta nota cobre os cinco runtimes documentados acima mais a descoberta de RamaLama, então revise o repositório se o seu faltar.
O resumo honesto: a discussão entre LM Studio e Ollama importa muito menos do que se acredita, e llmfit é a forma mais rápida de comprovar em seu próprio hardware, antes de gastar quarenta gigabytes descobrindo.