Por Grego · Categoría: AI & LLMs
Hay lanzamientos que importan por el modelo, y hay lanzamientos que importan por la tesis que traen debajo. Inkling —el primer modelo open-weights de Thinking Machines Lab, la startup de la ex-CTO de OpenAI Mira Murati— es de los segundos. Sí, es un MoE multimodal de 975B parámetros totales con 41B activos, contexto de 1M de tokens y los pesos completos descargables en Hugging Face. Pero lo que deberíamos discutir en Iberoamérica no es el tamaño: es que Thinking Machines lo publicó bajo licencia Apache-2.0 y dijo, con todas las letras, que “no es el modelo más fuerte disponible hoy”. Esa combinación —abrir los pesos y renunciar explícitamente a pelear por el score máximo— es una apuesta estratégica, no un descuido de marketing.
Y para los equipos de la región, esa apuesta cambia el cálculo de qué modelo elegir.
Qué es Inkling, en una respiración
Antes de la tesis, los hechos. Inkling es un transformer decoder-only de 66 capas con backbone Mixture-of-Experts (256 expertos ruteados + 2 compartidos), 975B parámetros totales y 41B activos por token. Fue preentrenado sobre 45 billones de tokens de texto, imágenes, audio y video, con arquitectura multimodal encoder-free. Soporta hasta 1M de tokens de contexto y se publicó con un checkpoint NVFP4 para inferencia eficiente. Los pesos están en Hugging Face (thinkingmachines/inkling) y el modelo está disponible para fine-tuning desde el día uno en Tinker, la plataforma de customización de la propia Thinking Machines, además de varios partners de inferencia (Together, Fireworks, Modal, Databricks, Baseten).
Hay también un preview de Inkling-Small (276B totales, 12B activos), pensado para workloads sensibles a costo y latencia, todavía en pruebas.
Nada de esto es lo interesante. Lo interesante es por qué lo hicieron así.
La tesis: tu ventaja no está en el modelo, está en lo que le agregás
El argumento de Thinking Machines es incómodo para el modelo de negocio dominante: sostienen que el conocimiento organizacional es específico de quien lo tiene, y que un laboratorio central vendiéndote un producto uniforme casi siempre va a rendir peor que una versión que vos ajustaste sobre tu propia base. En su marco, Inkling no es un producto de consumo que compite con un chatbot; es una base de customización para empresas, y el negocio de Thinking Machines no son las suscripciones sino Tinker: el entrenamiento, el fine-tuning y el hosting.
No es una voz aislada. Satya Nadella viene advirtiendo que las empresas “pagan dos veces” con los modelos cerrados —la suscripción, y encima el conocimiento de negocio que le entregás al proveedor cada vez que lo usás—. El CEO de Hugging Face ha predicho que el trabajo serio de producción va a migrar a alternativas privadas u open-source. Inkling es esa tesis convertida en pesos descargables bajo Apache-2.0.
Para un dev en Buenos Aires, Bogotá o Santiago, la parte que importa es la licencia. Apache-2.0 significa uso comercial sin pedir permiso, sin llamada de ventas, sin un contrato en inglés que tu equipo legal tarda tres semanas en revisar. Podés bajar los pesos, fine-tunear sobre tu dominio —tu jerga, tu código, tu vertical— y correrlo donde quieras. Es la diferencia entre alquilar inteligencia genérica y construir un activo propio sobre una base abierta.
El giro que casi nadie está mirando: medir por tokens, no solo por score
Acá está el punto que quiero que se lleven de este artículo, porque es el que cambia cómo elegimos modelos.
Durante dos años, la conversación fue una carrera de scores: quién saca más en tal benchmark. Inkling propone otro eje. Con su “controllable thinking effort” —podés modular cuánto “piensa” el modelo—, la métrica relevante deja de ser solo cuánto acierta y pasa a ser cuánto te cuesta acertar. Y ahí los números son concretos: según Artificial Analysis, Inkling promedia ~25K tokens de salida por tarea del Intelligence Index, contra ~37K–43K de competidores open-weights líderes como GLM-5.2, Kimi K2.6 o DeepSeek v4 Pro. Es alrededor de un 40% menos de tokens para un rendimiento comparable.
Y no es que sacrifique capacidad para lograrlo. En Terminal Bench 2.1 —el benchmark de tareas agénticas de terminal— Inkling marca 63.8% y le gana a Nemotron 3 Ultra (56.4%). En otros ejes sostiene el nivel: AIME 2026 en 97.1%, VoiceBench en 91.4%, MMMU Pro en 73.5%. O sea: gana en la tarea agéntica y gasta menos.
Nota para quien conozca el brief original: la versión que circulaba decía que Inkling “igualaba a Nemotron 3 Ultra en Terminal Bench usando un tercio de los tokens”. Los números reales son mejores en una parte y distintos en la otra —Inkling supera a Nemotron ahí, y la ventaja de tokens (~40%) está medida sobre el Intelligence Index, no sobre Terminal Bench—. Vale la pena decirlo bien: el dato correcto es más fuerte que el mito.
¿Por qué esto es estratégico y no un detalle técnico? Porque en producción, el costo se paga por token. Un modelo que resuelve la misma tarea con 40% menos de output es 40% más barato de operar a escala, con menos latencia. Para equipos iberoamericanos que compiten con presupuestos de infra más ajustados que los de Silicon Valley, la eficiencia de tokens no es una nota al pie: es la línea que separa un piloto viable de uno que no cierra. El score máximo lo paga el que puede permitírselo. La eficiencia la aprovecha el que sabe leer su factura.
Qué haría yo con esto si liderara un equipo en la región
Tres movimientos concretos.
Primero, evaluar Inkling como base de fine-tuning, no como reemplazo directo de tu API actual. La ventaja no aparece en el modelo base genérico; aparece cuando lo ajustás sobre tu dominio. Tinker baja la barrera de entrada (hay descuento de lanzamiento del 50%), pero la decisión de fondo es tratar al modelo como infraestructura propia, no como servicio alquilado.
Segundo, incorporar el costo por tarea a tu criterio de selección desde ahora, corras Inkling o no. Dejá de comparar modelos solo por su número en un leaderboard y empezá a medir tokens-por-tarea en tus casos de uso. Es una disciplina que se paga sola.
Tercero, si el dato o la latencia importan, mirá el self-hosting con ojos nuevos. Apache-2.0 más un checkpoint NVFP4 hacen que correr tu propio modelo —o el preview de Inkling-Small para cargas sensibles a costo— deje de ser un experimento de fin de semana y empiece a ser una opción de arquitectura seria. Con la salvedad honesta: la documentación de self-hosting todavía es delgada, así que esto es terreno para pilotear, no para prometerle a producción la semana que viene.
El fondo del asunto
Inkling no va a encabezar los leaderboards, y su equipo lo sabe y lo dijo. Esa franqueza es justamente la señal. La pregunta que instala no es “¿cuál es el modelo más inteligente?”, sino “¿de quién es la inteligencia que estás construyendo, y cuánto te cuesta cada respuesta?”. Para Iberoamérica, donde el diferencial rara vez va a ser el presupuesto de cómputo, empezar a responder esas dos preguntas —dueño del modelo, costo por token— puede ser más decisivo que perseguir el último punto de benchmark.
Murati apostó a que el futuro es abierto, customizable y medido en eficiencia. Vale la pena tomarse esa apuesta en serio.
Fuentes:
- Inkling: Our open-weights model — Thinking Machines Lab (15 jul 2026)
- Inkling Model Card — Thinking Machines Lab
- Pesos en Hugging Face —
thinkingmachines/inkling - Thinking Machines has released Inkling, the new leading U.S. open weights model — Artificial Analysis
- Thinking Machines amps up its bet against one-size-fits-all AI — TechCrunch
- Inkling: Our open-weights model — Simon Willison
