Kimi K3: 2.8 billones de parámetros, 1.56 TB, y una licencia que cambió de bando

Kimi K3: 2.8 billones de parámetros, 1.56 TB, y una licencia que cambió de bando

El 13 de junio escribí en estas páginas que la licencia Modified MIT de K2.7-Code era “una licencia con la que tus abogados pueden vivir”. Seis semanas después esa frase necesita un asterisco, y el asterisco es la noticia.

Moonshot AI publicó los pesos de Kimi K3 el 27 de julio, cumpliendo la promesa que había hecho el 16. Los pesos están en Hugging Face: 1.56 TB repartidos en 118 archivos. Esa parte salió exactamente como se anunció. Lo que no salió como se anunció es el papeleo que viene adjunto.

Qué se publicó realmente

K3 es un modelo Mixture-of-Experts con 2.8 billones de parámetros totales y 104 mil millones activos por token. La arquitectura son 93 capas —69 de Kimi Delta Attention, 24 de Gated MLA, una densa— sobre 896 experts, de los cuales se seleccionan 16 por token más 2 compartidos. La ventana de contexto es de 1.048.576 tokens.

El número que yo marcaría primero no es el conteo de parámetros. Es la cuantización. Los pesos son MXFP4 nativo con activaciones MXFP8, y Moonshot indica que eso viene de quantization-aware training aplicado desde la etapa de SFT en adelante —no de una pasada de compresión post-hoc sobre un checkpoint en bf16 antes de subirlo. La distinción importa, porque significa que el artefacto MXFP4 es el modelo que Moonshot entrenó y corre, no una copia degradada por conveniencia. Estás recibiendo el mismo formato numérico que el vendor usa internamente.

La consecuencia práctica es un footprint residente de aproximadamente 1.4 TB, a medio byte por parámetro, antes del KV cache y los buffers de activación. vLLM, SGLang y TokenSpeed lo manejan. Esto es un deployment multi-nodo, no una workstation. Self-hosteable es una afirmación verdadera acá, pero es una afirmación con una factura de hardware adjunta.

La licencia es la noticia

Moonshot no renovó la Modified MIT. K3 sale bajo un documento titulado, sin vueltas, “Kimi K3 License”. La cláusula operativa dice:

the Licensee must enter into a separate agreement with Moonshot AI

Esa obligación se activa cuando el licenciatario o sus afiliadas operan un negocio de Model as a Service —definido en la licencia como dar a terceros acceso a inferencia o fine-tuning de modelos de lenguaje, por ejemplo vía API, con control significativo sobre inputs, parámetros o datos de entrenamiento— cuyo revenue combinado supere los veinte millones de dólares en cualquier período de doce meses consecutivos. El acuerdo tiene que estar firmado antes del uso comercial, no después de cruzar el umbral. El requisito de branding de la era K2 sobrevive en paralelo: por encima de 100 millones de usuarios activos mensuales o veinte millones de dólares de revenue mensual, “Kimi K3” tiene que mostrarse de forma prominente en la interfaz.

Hay dos exenciones, y son la razón por la que esta cláusula es más angosta de lo que sugieren los titulares. El uso interno está exento. También lo está el acceso a través de los productos propios de Moonshot o de sus partners de inferencia certificados.

Hay que darle crédito a Moonshot en un punto: en ningún material propio llama a esto open source. El model card dice “Open Frontier Weights”. La empresa está describiendo con precisión lo que publicó, que es más de lo que se puede decir de una buena cantidad de releases de este año.

Qué cambia esto para un CTO en Iberoamérica

Si estás evaluando K3 para soberanía de datos —pesos en tu propia infraestructura, cero inferencia saliendo de tu perímetro, compliance aprobando— la cláusula de MaaS no te toca. El deployment interno está exento, punto. Tu decisión es una decisión de hardware: ¿puedes levantar y mantener vivo un cluster que sostenga 1.4 TB residentes más cache, y eso sale más barato en tres años que pagar una API?

La cuenta de esa segunda mitad es fácil de chequear, porque K3 ya está en OpenRouter con siete providers, todos a tres dólares por millón de tokens de input y quince por millón de output —las mismas tarifas que cobra Moonshot directamente. Un pricing uniforme entre siete providers te dice que el techo lo pone la licencia, no el mercado. Ese es tu baseline. El self-hosting tiene que ganarle.

La cláusula muerde en otro lado completamente distinto: si estás construyendo un producto que revende inferencia. Una plataforma regional de IA, un SaaS vertical con API de fine-tuning, un shop de inferencia gestionada —eso entra en territorio MaaS, y a los veinte millones de revenue anual necesita un acuerdo firmado con una empresa en Beijing para poder seguir operando. Veinte millones no es un número de hyperscaler. Es un negocio regional exitoso.

Así que el cálculo real ya no es “hardware versus API”. Es hardware, más API, más una pregunta sobre qué va a estar haciendo tu empresa en tres años. Si la respuesta es “correr modelos para nosotros mismos”, K3 es todo lo abierto que necesita ser. Si la respuesta es “vender acceso a modelos”, adquiriste una dependencia que ningún score de benchmark puede costear.

El patrón que vale la pena mirar

K2.7-Code fue permisivo porque Moonshot estaba comprando mindshare. K3 es revenue-tiered porque Moonshot ahora tiene un negocio que proteger. Nada de eso es escandaloso —es lo que hace una empresa cuando su modelo es lo bastante bueno como para que la gente pague. Pero sí significa que “open weight” dejó de ser una categoría estable sobre la que puedas planificar. Ahora es un atributo por release, y hay que releerlo cada vez.

La versión del argumento de soberanía que ya hice antes sigue en pie: pesos que puedes deployar le ganan a una API que solo puedes llamar. K3 no la revierte. Le agrega una cláusula. Lee la licencia antes que el leaderboard —este release es la evidencia más clara hasta ahora de que la licencia se mueve más rápido que el benchmark.


Caja técnica

Total / activos 2.8 billones / 104 mil millones por token
Experts 896 (16 activos + 2 shared)
Capas 93 — 69 KDA, 24 Gated MLA, 1 dense
Contexto 1.048.576 tokens
Formato MXFP4 pesos / MXFP8 activaciones, QAT desde SFT
Descarga 1.56 TB, 118 archivos
Residente ~1.4 TB + KV cache + buffers
Engines vLLM, SGLang, TokenSpeed
API $3/M input · $15/M output (7 providers en OpenRouter)

¿Estás evaluando K3 para deployment interno, o el producto que estás construyendo cae del lado MaaS de la cláusula? Cuéntanos cómo lo estás leyendo.