Por Grego · Categoria: AI & LLMs
Há lançamentos que importam pelo modelo, e há lançamentos que importam pela tese que trazem por baixo. Inkling — o primeiro modelo open-weights do Thinking Machines Lab, a startup da ex-CTO da OpenAI Mira Murati — é dos segundos. Sim, é um MoE multimodal de 975B parâmetros totais com 41B ativos, contexto de 1M de tokens e os pesos completos baixáveis no Hugging Face. Mas o que deveríamos discutir na Iberoamérica não é o tamanho: é que o Thinking Machines o publicou sob licença Apache-2.0 e disse, com todas as letras, que “não é o modelo mais forte disponível hoje”. Essa combinação — abrir os pesos e renunciar explicitamente a brigar pelo score máximo — é uma aposta estratégica, não um descuido de marketing.
E para os times da região, essa aposta muda o cálculo de qual modelo escolher.
O que é Inkling, em uma respiração
Antes da tese, os fatos. Inkling é um transformer decoder-only de 66 camadas com backbone Mixture-of-Experts (256 especialistas roteados + 2 compartilhados), 975B parâmetros totais e 41B ativos por token. Foi pré-treinado sobre 45 trilhões de tokens de texto, imagens, áudio e vídeo, com arquitetura multimodal encoder-free. Suporta até 1M de tokens de contexto e foi publicado com um checkpoint NVFP4 para inferência eficiente. Os pesos estão no Hugging Face (thinkingmachines/inkling) e o modelo está disponível para fine-tuning desde o primeiro dia no Tinker, a plataforma de customização do próprio Thinking Machines, além de vários parceiros de inferência (Together, Fireworks, Modal, Databricks, Baseten).
Há também um preview do Inkling-Small (276B totais, 12B ativos), pensado para workloads sensíveis a custo e latência, ainda em testes.
Nada disso é o interessante. O interessante é por que fizeram assim.
A tese: sua vantagem não está no modelo, está no que você agrega a ele
O argumento do Thinking Machines é incômodo para o modelo de negócio dominante: sustentam que o conhecimento organizacional é específico de quem o tem, e que um laboratório central vendendo um produto uniforme quase sempre vai render menos do que uma versão que você ajustou sobre sua própria base. No seu marco, Inkling não é um produto de consumo que compete com um chatbot; é uma base de customização para empresas, e o negócio do Thinking Machines não são as assinaturas, mas sim o Tinker: o treinamento, o fine-tuning e o hosting.
Não é uma voz isolada. Satya Nadella vem advertindo que as empresas “pagam duas vezes” com os modelos fechados — a assinatura, e além disso o conhecimento de negócio que você entrega ao fornecedor cada vez que o usa —. O CEO do Hugging Face predisse que o trabalho sério de produção vai migrar para alternativas privadas ou open-source. Inkling é essa tese convertida em pesos baixáveis sob Apache-2.0.
Para um dev em Buenos Aires, Bogotá ou Santiago, a parte que importa é a licença. Apache-2.0 significa uso comercial sem pedir permissão, sem ligação de vendas, sem um contrato em inglês que seu time jurídico demora três semanas para revisar. Você pode baixar os pesos, fazer fine-tuning sobre seu domínio — sua gíria, seu código, seu vertical — e rodá-lo onde quiser. É a diferença entre alugar inteligência genérica e construir um ativo próprio sobre uma base aberta.
A reviravolta que quase ninguém está mirando: medir por tokens, não só por score
Aqui está o ponto que quero que levem deste artigo, porque é o que muda como escolhemos modelos.
Durante dois anos, a conversa foi uma corrida de scores: quem tira mais em tal benchmark. Inkling propõe outro eixo. Com seu “controllable thinking effort” — você pode modular quanto o modelo “pensa” —, a métrica relevante deixa de ser só quanto acerta e passa a ser quanto te custa acertar. E aí os números são concretos: segundo Artificial Analysis, Inkling promedia ~25K tokens de saída por tarefa do Intelligence Index, contra ~37K–43K de competidores open-weights líderes como GLM-5.2, Kimi K2.6 ou DeepSeek v4 Pro. É em torno de um 40% menos de tokens para um rendimento comparável.
E não é que sacrifique capacidade para conseguir isso. Em Terminal Bench 2.1 — o benchmark de tarefas agênticas de terminal — Inkling marca 63.8% e vence Nemotron 3 Ultra (56.4%). Em outros eixos mantém o nível: AIME 2026 em 97.1%, VoiceBench em 91.4%, MMMU Pro em 73.5%. Ou seja: vence na tarefa agêntica e gasta menos.
Nota para quem conheça o brief original: a versão que circulava dizia que Inkling “igualava Nemotron 3 Ultra em Terminal Bench usando um terço dos tokens”. Os números reais são melhores em uma parte e distintos na outra — Inkling supera Nemotron ali, e a vantagem de tokens (~40%) está medida sobre o Intelligence Index, não sobre Terminal Bench —. Vale a pena dizer bem: o dado correto é mais forte que o mito.
Por que isso é estratégico e não um detalhe técnico? Porque em produção, o custo é pago por token. Um modelo que resolve a mesma tarefa com 40% menos de output é 40% mais barato de operar em escala, com menos latência. Para times iberoamericanos que competem com orçamentos de infraestrutura mais apertados que os do Vale do Silício, a eficiência de tokens não é uma nota de rodapé: é a linha que separa um piloto viável de um que não fecha. O score máximo o paga quem pode se permitir. A eficiência a aproveita quem sabe ler sua fatura.
O que eu faria com isso se liderasse um time na região
Três movimentos concretos.
Primeiro, avaliar Inkling como base de fine-tuning, não como substituto direto da sua API atual. A vantagem não aparece no modelo base genérico; aparece quando você o ajusta sobre seu domínio. Tinker reduz a barreira de entrada (há desconto de lançamento de 50%), mas a decisão de fundo é tratar o modelo como infraestrutura própria, não como serviço alugado.
Segundo, incorporar o custo por tarefa no seu critério de seleção desde agora, rode Inkling ou não. Deixa de comparar modelos só pelo seu número em um leaderboard e começa a medir tokens-por-tarefa nos seus casos de uso. É uma disciplina que se paga sozinha.
Terceiro, se o dado ou a latência importam, mira o self-hosting com olhos novos. Apache-2.0 mais um checkpoint NVFP4 fazem com que rodar seu próprio modelo — ou o preview do Inkling-Small para cargas sensíveis a custo — deixe de ser um experimento de fim de semana e comece a ser uma opção de arquitetura séria. Com a ressalva honesta: a documentação de self-hosting ainda é delgada, então isso é terreno para pilotar, não para prometer a produção na próxima semana.
O fundo da questão
Inkling não vai encabeçar os leaderboards, e seu time sabe e o disse. Essa franqueza é justamente o sinal. A pergunta que instala não é “qual é o modelo mais inteligente?”, mas sim “de quem é a inteligência que você está construindo, e quanto te custa cada resposta?”. Para a Iberoamérica, onde o diferencial raramente vai ser o orçamento de computação, começar a responder essas duas perguntas — dono do modelo, custo por token — pode ser mais decisivo que perseguir o último ponto de benchmark.
Murati apostou que o futuro é aberto, customizável e medido em eficiência. Vale a pena levar essa aposta a sério.
Fontes:
- Inkling: nosso modelo de pesos abertos — Thinking Machines Lab (15 jul 2026)
- Inkling Model Card — Thinking Machines Lab
- Pesos en Hugging Face —
thinkingmachines/inkling - Thinking Machines lançou Inkling, o novo modelo de pesos abertos líder dos EUA — Artificial Analysis
- Thinking Machines aposta contra IA única para todos — TechCrunch
- Inkling: nosso modelo de pesos abertos — Simon Willison
