3,5× menos tokens e o mesmo score: Toast 1 fica com todo o loop de busca do seu agente
Em 13 de agosto a Mixedbread lançou Toast 1, um modelo treinado para uma única coisa: buscar. Não é um assistente geral e não pretende ser. Você o encaixa abaixo do modelo que já usa — Claude, GPT, o que quer que rode seu agente — e ele fica com todo o loop de retrieval: decompõe a consulta em subqueries, junta evidência, inspeciona as fontes e devolve o contexto já curado.
O número do título sai do benchmark LAB Firm Knowledge da Harvey: de 80,6M tokens para 23M, com o score sem se mexer em 55. Mesmo resultado, 3,5× menos tokens.
Antes de você reescrever seu stack em volta dessa cifra, vale a pena ler com cuidado a tabela de onde ela sai. Porque esse 3,5× não é o que Toast 1 faz por si só.
A tabela, lida linha por linha
Mixedbread rodou o benchmark em três configurações. Isto é o que publicaram:
| Configuração | Tokens | Turnos/tarefa | Score |
|---|---|---|---|
| Agente vanilla | 80,6M | 21,7 | 55 |
| + Mixedbread Search | 47M (−42%) | 14,6 | 55 |
| + Toast 1 como subagente | 23M (−51% adicional) | 11,2 | 55 |
Fique atento a de onde vêm as economias. O primeiro corte — de 80,6M para 47M, a queda individual maior das duas — não tem nada a ver com Toast 1. Vem de trocar o backend de retrieval por Mixedbread Search. Toast 1 entra recém na terceira linha e aproximadamente divide pela metade o que restava.
Ainda assim é um número excelente. Mas muda o que a história significa para você: se você não adotar sua camada de retrieval, a cifra realista com a qual planejar está mais perto de 2× do que de 3,5×. Mixedbread é direto sobre isto no post — Toast 1 “was co-designed with Mixedbread Search’s primitives and will be at its strongest performance with it”, embora ainda seja “backend agnostic: it can run over your existing retrieval indexes”. Ou seja: foi desenhado junto com as primitivas de Mixedbread Search e rende ao máximo com elas, mas pode rodar sobre seus índices atuais. Leia essa frase pelo que ela é: o 3,5× é um número de dois produtos.
O conteo de turnos é a métrica que eu olharia com mais atenção que a de tokens, na verdade. De 21,7 para 11,2 turnos por tarefa é o loop fechando na metade das idas e voltas, e os turnos são o que você sente como latência e o que quebra quando uma execução longa do agente começa a derrapar.
Uma coisa que o post não define: quanto vale um score de 55, nem o que mede exatamente. É um benchmark da Harvey, não da Mixedbread, o que joga a favor — mas a escala absoluta não está no post, então “sem mudanças em 55” te diz que não houve regressão, não o quão bom era o baseline.
O segundo benchmark, que é o mais interessante
Abaixo do benchmark legal há uma execução sobre OfficeQA Pro V2 (Databricks) que monta melhor o caso:
- GPT-5.6 Sol, sozinho: 33% de respostas corretas
- Claude Fable 5, o melhor resultado anterior: 60% a uns $4 por tarefa
- GPT-5.6 Sol + Toast 1 dentro de Codex: 70% a uns $1,15–$1,20 por tarefa
Essa é a forma interessante. O mesmo modelo base passa de 33% para 70% delegando a busca, e vence o melhor resultado anterior a menos de um terço do custo. Aqui a história não é “o mesmo por menos” — é “um modelo de custo médio mais retrieval especializado vence o modelo caro buscando por sua conta”.
Os dois benchmarks são execuções do próprio vendor. Mixedbread publicou o harness que usaram (mixedbread-ai/toast-harness, Apache-2.0), o que é mais do que a maioria faz, mas ainda ninguém reproduziu esses números de forma independente.
O que custa, incluída a parte que não está no título
Preço de lançamento do modelo:
- $0,30 por milhão de tokens de entrada
- $0,036 por milhão de tokens de entrada em cache (as escritas de cache são grátis)
- $0,72 por milhão de tokens de saída
Por query, Mixedbread reporta $0,016–$0,023 em uma execução padrão e $0,05–$0,07 na configuração de fusão de alta qualidade, com uma latência mediana de 8–11 segundos. Sua comparação é contra agentes de retrieval baseados em modelos frontier, que demoram entre 20 segundos e 4 minutos.
Agora a aritmética que ninguém coloca no post de lançamento. Toast 1 não só reduz uma conta — move uma parte dela para uma linha nova. Os tokens que você deixa de pagar ao seu provedor frontier voltam como cobranças de Mixedbread, e são mais que só o modelo:
- Indexing: $1,50 por milhão de tokens (Fast) ou $3 por milhão (High Quality com OCR)
- Semantic search: $4 para cada 1.000 queries, $3,50 com reranking
- Storage: $0,50 por milhão de content tokens ao mês
Que o “>60% menos custo” se sustente em sua workload depende de como cair esse repartição. Uma workload com um corpus grande e que muda o tempo todo paga muito indexing para economizar pouco em busca; um corpus estável com muito volume de queries é onde os números funcionam. Faça essa conta com seus próprios volumes antes de se comprometer — o benchmark tem a forma de 33 tarefas contra um corpus fixo, que é o caso amigável.
Há $5 em créditos ao registrar uma API key, suficiente para rodar uma avaliação real, e até $250 para startups com investimento de VC.
Colocar para rodar
Três portas de entrada, de menos a mais trabalho.
1. Ativar um flag sobre uma store existente
Se você já tem documentos em uma store de Mixedbread, a busca agêntica é um booleano:
from mixedbread import Mixedbread
mxbai = Mixedbread(api_key="YOUR_API_KEY")
results = mxbai.stores.search(
query="What are the yearly numbers for 2020-2025?",
store_identifiers=["yearly-reports"],
search_options={"agentic": True},
)
O formato de resposta é idêntico ao de uma busca padrão, então é uma substituição drop-in — você não toca no código que consome os resultados. Sob search_options.agentic há dois campos opcionais:
instructions— guia em texto livre que se agrega ao system prompt do agente, até 5.000 caracteresstrict_top_k— emtruelimita os resultados a exatamentetop_kchunks; emfalsedeixa que o agente devolva tudo que considere relevante
Por dentro roda subqueries em paralelo e itera até 4 rodadas antes de entregar os resultados rankeados. A recomendação do próprio Mixedbread vale a pena repetir: isto é para consultas que abrangem múltiplas entidades, anos ou fontes, ou onde uma única lista top-k continua perdendo coisas. Para lookups pontuais, a busca normal é mais rápida e mais barata. Não ative isto de forma global.
2. Agregá-lo ao seu coding agent como skill
npx skills add mixedbread-ai/skills
O repo (Apache-2.0) funciona com Claude Code, Cursor, Codex, Gemini CLI e 20+ mais através do registry de skills. Traz cinco skills:
mxbai-cli— administrar knowledge bases, subir documentos e buscar do terminalmixedbread-search— construir e consultar knowledge bases gerenciadas via API/SDKmixedbread-parsing— extração estruturada e OCRmixedbread-search-agent— Toast 1 através da Chat Completions APImixedbread-search-agent-harness— loops de busca customizados
Este é o caminho se o que você quer é que seu coding agent deixe de entrar na espiral de grep e ler arquivo atrás de arquivo sobre um repo ou um set de documentos grande.
3. Rodar o harness você mesmo
pip install toast-harness
toast-harness é o que Mixedbread usou para produzir os números do benchmark, e é a peça que eu instalaria primeiro se quisesse verificá-los. Expõe ferramentas de retrieval sobre uma store de Mixedbread e gerencia o loop do agente, funciona com qualquer modelo compatível com OpenAI, é async-native com uma camada de compatibilidade síncrona e — o detalhe que importa nessa história em particular — faz contagem exata de tokens em lugar de estimativa por caracteres. Se você vai discutir uma redução de 3,5× em tokens, quer que o contador seja exato.Você precisa de uma chave de API do Mixedbread (MXBAI_API_KEY) e um endpoint compatível com OpenAI. Aceita clientes de retrieval e funções de geração próprias, que é a costura por onde você o aponta para seu próprio índice em vez do deles — e portanto a forma de medir quanto do 3,5× sobrevive sem Mixedbread Search por baixo.
A aposta que há por baixo
Toast 1 é uma instância de um padrão que aparece cada vez mais: o modelo frontier é a forma mais cara de fazer retrieval, e o retrieval é a maior parte do que um agente faz o dia todo. Um modelo grande buscando é um modelo grande gastando sua context window em ler coisas que vai descartar, à tarifa frontier por token, para uma tarefa que não precisa de raciocínio frontier.
Se essa aritmética — o que se paga exatamente, por quê, e como medir antes de decidir — não te parece óbvia, Qué son los tokens en la IA y por qué te cobran por ellos a desfaz desde o começo.
Especializar essa camada é o mesmo movimento que colocar um índice em uma coluna de banco de dados. Só rende quando você está fazendo muito — que, se você roda agentes sobre qualquer corpus real, é o seu caso.
O contrapeso honesto: você está adicionando um vendor no caminho crítico de cada query do seu agente, os benchmarks são auto-informados, e o número mais forte exige também adotar seu backend de retrieval. Os $5 de crédito e o harness aberto existem justamente para você testar contra seu corpus em vez do deles. Faça isso antes de recabiar nada.
Você já mediu que fração dos tokens do seu agente vai em buscar e quanto em raciocinar? Conte nos comentários, especialmente se testou separar o retrieval em um modelo à parte e não terminou rendendo.