Aleph Alpha publicó Kolibri el 3 de octubre de 2026: un modelo de razonamiento mixture of experts en alemán e inglés con 78B parámetros, de los que solo 3,46B trabajan en cada token, con pesos abiertos bajo Apache 2.0. Esa proporción hace que cada token sea barato de calcular, pero los 78B completos tienen que estar en la memoria de la GPU: el mínimo son dos A100 de 80 GB, no una laptop.
¿Qué es Kolibri de Aleph Alpha?
Kolibri es un open-weight model de razonamiento entrenado desde cero por Aleph Alpha, el laboratorio de Heidelberg detrás de los modelos Pharia. La ficha del modelo no declara dependencias de otros modelos: no es un fine-tune de Llama, Qwen ni de nadie más.
Lo que trae:
- modo de razonamiento explícito con esfuerzo ajustable
- tool calling
- ventana de contexto nativa de 262.144 tokens, validada hasta 1.048.576
Aleph Alpha lo posiciona para razonamiento de varios pasos, retrieval-augmented generation (RAG), agentes con herramientas, programación y asistentes en alemán e inglés. Su conocimiento llega hasta el 18 de junio de 2026.
Hay dos repositorios oficiales:
Aleph-Alpha/Kolibri-1es la versión FP8, la que con más probabilidad vas a desplegar.Aleph-Alpha/Kolibri-1-BF16contiene los pesos en precisión completa.
¿Qué es un modelo mixture of experts y qué significan 3,46B de parámetros activos?
Significa que Kolibri calcula como un modelo de 3B y ocupa memoria como uno de 78B.
Kolibri es un modelo mixture of experts (MoE). Cada una de sus 50 capas contiene 384 pequeñas redes “expertas” más un experto compartido. Para cada token, un router elige 6 de los 384 expertos, y solo esos (más el compartido y las capas de atención) hacen trabajo. Eso suma 3,46B de active parameters sobre 78,1B totales.
De ese diseño salen dos costos que se mueven en direcciones opuestas:
- El cómputo por token sigue a los parámetros activos. Generar un token cuesta más o menos lo que cuesta un modelo denso de 3 a 4B. De ahí vienen el ahorro en throughput y el menor costo de servirlo.
- La memoria sigue a los parámetros totales. El router puede elegir cualquier experto para el siguiente token, así que todos tienen que estar cargados y listos. La propia ficha de Aleph Alpha lo reconoce: la memoria es el precio a pagar.
Kolibri también ahorra en atención. Cuatro de cada cinco capas solo miran los 512 tokens anteriores (sliding-window attention) y solo una de cada cinco atiende al contexto completo. Eso es lo que permite servir contextos muy largos a un costo razonable.
¿Cuánta VRAM necesita Kolibri?
La versión FP8 necesita como mínimo dos A100 de 80 GB, dos H100 o una sola H200. Estos son los datos de las fichas oficiales:
Kolibri-1 (FP8) |
Kolibri-1-BF16 |
|
|---|---|---|
| Pesos en memoria | ~78 GB | ~156 GB |
| Mínimo | 2× A100 80 GB, 2× H100 SXM5, 1× H200, 1× B200 o 1× B300 | 4× A100 80 GB, 4× H100 SXM5, 2× H200, 1× B200 o 1× B300 |
| Recomendado | 2× H100 SXM5, 2× H200, 1× B200 o 1× B300 | 4× H100 SXM5, 2× H200, 2× B200 o 1× B300 |
FP8 es el formato de despliegue previsto, no un recorte añadido después. Durante el aprendizaje por refuerzo, Aleph Alpha usó quantization-aware training precisamente para que el modelo funcione bien en baja precisión con vLLM. La versión FP8 guarda los pesos en FP8 y mantiene en bfloat16 los embeddings, la cabeza de salida, las normalizaciones y el router MoE.
Sobre el largo de contexto, la ficha recomienda no superar los 262.144 tokens en despliegues sensibles a latencia o throughput. La ventana de 1M está disponible, pero necesita flags adicionales (ver más abajo).
Al momento de publicar esta nota, Hugging Face listaba varias cuantizaciones comunitarias de Kolibri etiquetadas para llama.cpp, LM Studio y Ollama. No son de Aleph Alpha y la ficha no las evalúa, así que su calidad es desconocida hasta que las pruebes.
¿Cómo instalar y servir Kolibri con vLLM?
Instala el paquete de inferencia de Aleph Alpha y luego ejecuta vllm serve con los parsers propios de Kolibri. El paquete trae el plugin de Kolibri para vLLM e instala la versión de vLLM que soporta:
pip install 'aleph-alpha-inference>=1'
Si prefieres no instalarlo, Aleph Alpha también publica una imagen de contenedor: ghcr.io/aleph-alpha/aleph-alpha-inference.
Sirve el modelo FP8 con razonamiento y tool calling activados:
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice
Para superar los 262.144 tokens de contexto, agrega estos flags:
--max-model-len 1048576 --hf-overrides '{"max_position_embeddings": 1048576}'
Los parámetros de muestreo recomendados son temperature=1.0, top_p=0.97 y top_k=128.
¿Cómo se llama a Kolibri desde código?
Apunta cualquier cliente de OpenAI al servidor. vLLM expone una API compatible con OpenAI, y el ejemplo de la ficha usa http://localhost:8000/v1:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
response = client.chat.completions.create(
model="Aleph-Alpha/Kolibri-1",
messages=[{"role": "user", "content": "Explain briefly what a mixture-of-experts model is."}],
extra_body={
"chat_template_kwargs": {
"reasoning_effort": "high",
"enable_thinking": True,
}
},
)
print(response.choices[0].message.content)
El parámetro reasoning_effort acepta low, medium y high. Si lo pones en none, o pasas enable_thinking=false, el modelo responde de inmediato, sin razonar.
El tool calling es estilo Hermes: pasa tus esquemas de funciones en el campo estándar tools. Puedes combinarlo con el modo de razonamiento.
Como el endpoint habla la API de OpenAI, cualquier agente que te deje traer tu propio modelo puede apuntar a él. Goose es un ejemplo.
Kolibri vs Qwen: ¿es realmente mejor?
En los benchmarks de la propia Aleph Alpha, Kolibri tiene el mejor puntaje global entre los modelos MoE con los que se compara. Pero pierde con claridad en tareas de agentes de programación, y todas estas cifras son autorreportadas. Aleph Alpha corrió todos los modelos con su propio eval-framework, y al momento de publicar esta nota no había evaluaciones independientes.
Cifras de la ficha FP8:
| Benchmark | Kolibri | Qwen3.5 35B-A3B | Qwen3.6 35B-A3B | GPT-OSS 120B |
|---|---|---|---|---|
| Global (EN) | 75,5 | 74,7 | 71,4 | 72,3 |
| Global (DE) | 70,8 | 69,8 | 67,3 | 70,2 |
| AIME 2025 (EN) | 96,9 | 88,1 | 84,6 | 90,6 |
| LiveCodeBench v6 | 85,9 | 77,8 | 82,5 | 87,5 |
| SWE-Bench Verified | 66,4 | 71,6 | 73,8 | – |
| TerminalBench 2.1 | 27,7 | 39,7 | – | 29,2 |
| BFCL v4 (global) | 61,4 | 70,5 | 67,2 | 57,3 |
El patrón: Kolibri es fuerte en matemáticas, razonamiento y RAG en alemán e inglés, y más débil en agentes de ingeniería de software y en tool calling de varios turnos.
El comentario principal en el hilo de Hacker News señala que el denso Qwen3.8 27B supera a Kolibri en alemán (79,9 contra 70,8) con el propio harness de Kolibri. Es cierto, y la cifra está en la tabla de Aleph Alpha. Lo que el comentario omite es que Qwen3.8 27B es un modelo denso: sus 27B parámetros trabajan en cada token, unas ocho veces el cómputo por token de Kolibri. Aleph Alpha muestra los modelos densos en gris, como referencia, no como rivales directos. La lectura justa es que Kolibri cambia algo de calidad por mucho menos cómputo por token.
Lo mismo pasa con las alucinaciones. En la tasa de no alucinación de AA-Omniscience, Kolibri saca 44,0 contra 56,7 de Qwen3.6.
¿Kolibri funciona en español?
No de forma oficial. Kolibri soporta solo alemán e inglés. La ficha lo describe como una elección deliberada de profundidad por sobre amplitud, y el español no aparece en ninguna de sus evaluaciones.
La mezcla de preentrenamiento fue de aproximadamente 62,5% inglés, 23,9% alemán y 13,6% código. Vas a obtener respuestas en español, pero nada garantiza su calidad. Si tus usuarios escriben en español, evalúalo con tus propios datos antes de comprometerte.
¿Kolibri es gratis para uso comercial?
Sí, en cuanto a los pesos: están publicados bajo Apache 2.0. La ficha añade un límite: la licencia aplica solo a los pesos y archivos de configuración del repositorio. El código, la arquitectura del modelo, los parámetros y los métodos de entrenamiento quedan excluidos de forma explícita, y Aleph Alpha conserva esos derechos.
La nota de Grego: qué significa “soberano” cuando el laboratorio se vende
Aleph Alpha lanzó Kolibri como un modelo “soberano”. El comentario principal en Hacker News hizo la pregunta obvia: en abril de 2026, Cohere, con sede en Toronto, acordó adquirir Aleph Alpha. Según lo reportado, los accionistas de Aleph Alpha quedarían con alrededor del 10% de la empresa combinada, que operará bajo el nombre Cohere. Al momento de publicar esta nota, no pude confirmar que la operación se hubiera cerrado.
No creo que eso le quite valor al lanzamiento, pero sí muestra dónde vive realmente la soberanía. No le pertenece a un proveedor: un proveedor se compra, se fusiona o se reposiciona en un trimestre. Le pertenece al artefacto: pesos entrenados desde cero, bajo Apache 2.0, que puedes correr en hardware que controlas, en la jurisdicción que elijas. Una vez que esos pesos están en tu servidor, quién sea dueño de Kolibri no cambia nada para ti.
Hay dos detalles más que importan a quien vende en Europa, incluidos nuestros lectores en España. Aleph Alpha firmó el Código de Buenas Prácticas de la UE para modelos de IA de uso general, y publica un resumen de sus datos de entrenamiento con la plantilla de la Comisión Europea. Si tu equipo de cumplimiento pregunta de dónde salieron los datos de un modelo, este es uno de los pocos lanzamientos open-weight que trae los papeles.
¿Para quién tiene sentido Kolibri?
Kolibri tiene sentido si ya tienes, o puedes alquilar, un nodo con una H200 o dos H100, y tu carga de trabajo es RAG sobre documentos largos, razonamiento o procesamiento bilingüe alemán/inglés. En ese hardware, un modelo con 3,46B parámetros activos te da mucho throughput por GPU.
No es la opción indicada en tres casos:
- Agentes de programación: según las propias cifras de Aleph Alpha, los MoE de Qwen rinden mejor en SWE-Bench y TerminalBench.
- Productos en español: el español no está evaluado.
- Correrlo en tu laptop: para eso, mira un modelo denso pequeño como Ornith-1.5-9B, o los MoE de la familia Gemma 4, que también aparecen en la tabla comparativa de Kolibri.
- En mi laptop o PC
- En un servidor propio o GPUs alquiladas
- No los corro: uso APIs de terceros
- Prefiero otra opción (cuéntanos cuál)
Relacionado: 5,63 GB en tu laptop y 70.6 en SWE-bench Verified: instalando Ornith-1.5-9B