Aleph Alpha publicou Kolibri em 3 de outubro de 2026: um modelo de raciocínio mixture of experts em alemão e inglês com 78B parâmetros, dos quais apenas 3,46B trabalham em cada token, com pesos abertos sob Apache 2.0. Essa proporção torna cada token barato de calcular, mas os 78B completos precisam estar na memória da GPU: o mínimo são dois A100 de 80 GB, não um laptop.
O que é Kolibri da Aleph Alpha?
Kolibri é um open-weight model de raciocínio treinado do zero pela Aleph Alpha, o laboratório de Heidelberg por trás dos modelos Pharia. A ficha do modelo não declara dependências de outros modelos: não é um fine-tune de Llama, Qwen ou de mais ninguém.
O que oferece:
- modo de raciocínio explícito com esforço ajustável
- tool calling
- janela de contexto nativa de 262.144 tokens, validada até 1.048.576
Aleph Alpha o posiciona para raciocínio de múltiplos passos, retrieval-augmented generation (RAG), agentes com ferramentas, programação e assistentes em alemão e inglês. Seu conhecimento chega até 18 de junho de 2026.
Há dois repositórios oficiais:
Aleph-Alpha/Kolibri-1é a versão FP8, a que você provavelmente vai desplegar.Aleph-Alpha/Kolibri-1-BF16contém os pesos em precisão completa.
O que é um modelo mixture of experts e o que significam 3,46B de parâmetros ativos?
Significa que Kolibri calcula como um modelo de 3B e ocupa memória como um de 78B.
Kolibri é um modelo mixture of experts (MoE). Cada uma de suas 50 camadas contém 384 pequenas redes “especialistas” mais um especialista compartilhado. Para cada token, um router escolhe 6 dos 384 especialistas, e apenas esses (mais o compartilhado e as camadas de atenção) fazem trabalho. Isso soma 3,46B de active parameters sobre 78,1B totais.
Desse design surgem dois custos que se movem em direções opostas:
- A computação por token segue os parâmetros ativos. Gerar um token custa mais ou menos o que custa um modelo denso de 3 a 4B. Daí vêm a economia em throughput e o menor custo de servi-lo.
- A memória segue os parâmetros totais. O router pode escolher qualquer especialista para o próximo token, então todos precisam estar carregados e prontos. A própria ficha da Aleph Alpha reconhece isso: a memória é o preço a pagar.
Kolibri também economiza em atenção. Quatro de cada cinco camadas apenas olham os 512 tokens anteriores (sliding-window attention) e apenas uma de cada cinco atende ao contexto completo. Isso é o que permite servir contextos muito longos a um custo razoável.
Quanta VRAM Kolibri precisa?
A versão FP8 precisa no mínimo de dois A100 de 80 GB, dois H100 ou um H200. Estes são os dados das fichas oficiais:
Kolibri-1 (FP8) |
Kolibri-1-BF16 |
|
|---|---|---|
| Pesos em memória | ~78 GB | ~156 GB |
| Mínimo | 2× A100 80 GB, 2× H100 SXM5, 1× H200, 1× B200 ou 1× B300 | 4× A100 80 GB, 4× H100 SXM5, 2× H200, 1× B200 ou 1× B300 |
| Recomendado | 2× H100 SXM5, 2× H200, 1× B200 ou 1× B300 | 4× H100 SXM5, 2× H200, 2× B200 ou 1× B300 |
FP8 é o formato de despliegue previsto, não um corte adicionado depois. Durante o aprendizado por reforço, Aleph Alpha usou quantization-aware training precisamente para que o modelo funcione bem em baixa precisão com vLLM. A versão FP8 armazena os pesos em FP8 e mantém em bfloat16 os embeddings, a cabeça de saída, as normalizações e o router MoE.
Sobre o comprimento de contexto, a ficha recomenda não ultrapassar 262.144 tokens em despliegues sensíveis a latência ou throughput. A janela de 1M está disponível, mas precisa de flags adicionais (veja abaixo).
No momento de publicar esta nota, Hugging Face listava várias quantizações comunitárias de Kolibri etiquetadas para llama.cpp, LM Studio e Ollama. Não são da Aleph Alpha e a ficha não as avalia, então sua qualidade é desconhecida até que você as teste.
Como instalar e servir Kolibri com vLLM?
Instale o pacote de inferência da Aleph Alpha e execute vllm serve com os parsers próprios de Kolibri. O pacote traz o plugin de Kolibri para vLLM e instala a versão de vLLM que oferece suporte:
pip install 'aleph-alpha-inference>=1'
Se preferir não instalá-lo, Aleph Alpha também publica uma imagem de contêiner: ghcr.io/aleph-alpha/aleph-alpha-inference.
Serva o modelo FP8 com raciocínio e tool calling ativados:
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice
Para superar os 262.144 tokens de contexto, adicione estes flags:
--max-model-len 1048576 --hf-overrides '{"max_position_embeddings": 1048576}'
Os parâmetros de amostragem recomendados são temperature=1.0, top_p=0.97 e top_k=128.
Como chamar Kolibri a partir do código?
Aponte qualquer cliente OpenAI para o servidor. vLLM expõe uma API compatível com OpenAI, e o exemplo da ficha usa http://localhost:8000/v1:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
response = client.chat.completions.create(
model="Aleph-Alpha/Kolibri-1",
messages=[{"role": "user", "content": "Explain briefly what a mixture-of-experts model is."}],
extra_body={
"chat_template_kwargs": {
"reasoning_effort": "high",
"enable_thinking": True,
}
},
)
print(response.choices[0].message.content)
O parâmetro reasoning_effort aceita low, medium e high. Se você o definir como none, ou passar enable_thinking=false, o modelo responde imediatamente, sem raciocinar.
O tool calling é estilo Hermes: passa teus esquemas de funções no campo padrão tools. Podes combiná-lo com o modo de raciocínio.
Como o endpoint fala a API do OpenAI, qualquer agente que te deixe trazer teu próprio modelo pode apontá-lo. Goose é um exemplo.
Kolibri vs Qwen: é realmente melhor?
Nos benchmarks do próprio Aleph Alpha, Kolibri tem a melhor pontuação global entre os modelos MoE com os quais se compara. Mas perde com clareza em tarefas de agentes de programação, e todos esses números são autorrelatados. Aleph Alpha executou todos os modelos com seu próprio eval-framework, e no momento da publicação desta nota não havia avaliações independentes.
Números da ficha FP8:
| Benchmark | Kolibri | Qwen3.5 35B-A3B | Qwen3.6 35B-A3B | GPT-OSS 120B |
|---|---|---|---|---|
| Global (EN) | 75,5 | 74,7 | 71,4 | 72,3 |
| Global (DE) | 70,8 | 69,8 | 67,3 | 70,2 |
| AIME 2025 (EN) | 96,9 | 88,1 | 84,6 | 90,6 |
| LiveCodeBench v6 | 85,9 | 77,8 | 82,5 | 87,5 |
| SWE-Bench Verified | 66,4 | 71,6 | 73,8 | – |
| TerminalBench 2.1 | 27,7 | 39,7 | – | 29,2 |
| BFCL v4 (global) | 61,4 | 70,5 | 67,2 | 57,3 |
O padrão: Kolibri é forte em matemática, raciocínio e RAG em alemão e inglês, e mais fraco em agentes de engenharia de software e em tool calling de múltiplos turnos.
O comentário principal na thread do Hacker News aponta que o denso Qwen3.8 27B supera Kolibri em alemão (79,9 contra 70,8) com o próprio harness de Kolibri. É verdade, e o número está na tabela de Aleph Alpha. O que o comentário omite é que Qwen3.8 27B é um modelo denso: seus 27B parâmetros trabalham em cada token, cerca de oito vezes o cálculo por token de Kolibri. Aleph Alpha mostra os modelos densos em cinza, como referência, não como rivais diretos. A leitura justa é que Kolibri troca um pouco de qualidade por muito menos cálculo por token.
O mesmo acontece com alucinações. Na taxa de não alucinação de AA-Omniscience, Kolibri marca 44,0 contra 56,7 de Qwen3.6.
Kolibri funciona em português?
Não oficialmente. Kolibri suporta apenas alemão e inglês. A ficha o descreve como uma escolha deliberada de profundidade em vez de amplitude, e o português não aparece em nenhuma de suas avaliações.
A mistura de pré-treinamento foi de aproximadamente 62,5% inglês, 23,9% alemão e 13,6% código. Vais obter respostas em português, mas nada garante sua qualidade. Se teus usuários escrevem em português, avalia com teus próprios dados antes de se comprometer.
Kolibri é gratuito para uso comercial?
Sim, quanto aos pesos: estão publicados sob Apache 2.0. A ficha adiciona um limite: a licença se aplica apenas aos pesos e arquivos de configuração do repositório. O código, a arquitetura do modelo, os parâmetros e os métodos de treinamento ficam explicitamente excluídos, e Aleph Alpha mantém esses direitos.
A nota de Grego: o que significa “soberano” quando o laboratório é vendido
Aleph Alpha lançou Kolibri como um modelo “soberano”. O comentário principal no Hacker News fez a pergunta óbvia: em abril de 2026, Cohere, com sede em Toronto, concordou em adquirir Aleph Alpha. Conforme reportado, os acionistas de Aleph Alpha ficaria com cerca de 10% da empresa combinada, que operaria sob o nome Cohere. No momento da publicação desta nota, não consegui confirmar que a operação tivesse fechado.
Não acho que isso tire valor do lançamento, mas mostra onde realmente vive a soberania. Não pertence a um fornecedor: um fornecedor é comprado, fundido ou reposicionado em um trimestre. Pertence ao artefato: pesos treinados do zero, sob Apache 2.0, que podes rodar em hardware que controlas, na jurisdição que escolhas. Uma vez que esses pesos estão no teu servidor, quem seja dono de Kolibri não muda nada para ti.
Há dois detalhes a mais que importam a quem vende na Europa, incluindo nossos leitores no Brasil. Aleph Alpha assinou o Código de Boas Práticas da UE para modelos de IA de uso geral, e publica um resumo de seus dados de treinamento com o modelo da Comissão Europeia. Se tua equipe de conformidade pergunta de onde vieram os dados de um modelo, este é um dos poucos lançamentos open-weight que traz os papéis.
Para quem faz sentido Kolibri?
Kolibri faz sentido se já tens, ou podes alugar, um nó com uma H200 ou dois H100, e tua carga de trabalho é RAG sobre documentos longos, raciocínio ou processamento bilíngue alemão/inglês. Nesse hardware, um modelo com 3,46B parâmetros ativos te dá muito throughput por GPU.
Não é a opção indicada em três casos:
- Agentes de programação: conforme os próprios números de Aleph Alpha, os MoE de Qwen rendem melhor em SWE-Bench e TerminalBench.
- Produtos em português: o português não está avaliado.
- Rodá-lo no teu laptop: para isso, vê um modelo denso pequeno como Ornith-1.5-9B, ou os MoE da família Gemma 4, que também aparecem na tabela comparativa de Kolibri.
- No meu laptop ou PC
- Em um servidor próprio ou GPUs alugadas
- Não os rodo: uso APIs de terceiros
- Prefiro outra opção (nos conta qual)
Relacionado: 5,63 GB no seu laptop e 70,6 em SWE-bench Verified: instalando Ornith-1.5-9B