Hoje lançamos yoDEV Decisions, uma ferramenta gratuita para membros da yoDEV que executa a mesma pergunta no Jev e no LLM que você escolher, linha por linha, e compara os resultados: precisão, calibração, custo e latência.
A ideia surgiu do nosso artigo sobre Jev da TypeSafe. Lá concluímos que os números de um provedor não substituem uma medição própria e que os times da Ibero-América precisam medir com seus dados, em seu idioma. Decisions é essa medição.
yoDEV cobre as chamadas ao Jev. Para o lado do LLM você conecta sua própria conta do OpenRouter.
O que mostram os primeiros resultados?
Para os resultados públicos escolhemos quatro LLMs populares (GPT-4o mini, Gemini 2.5 Flash, Claude Haiku 4.5 e Llama 3.3 70B) e quatro conjuntos de dados públicos, de 200 linhas cada um, com a pergunta formulada em espanhol. Com seus próprios dados você pode comparar Jev com qualquer modelo disponível no OpenRouter, incluindo modelos gratuitos.
| Conjunto | Tarefa | Jev | Melhor LLM |
|---|---|---|---|
| Banking77 | Intenção de um cliente bancário, entre 77 opções | 82,0 % | 84,0 % (Gemini 2.5 Flash) |
| SMS spam | É spam? | 97,0 % | 98,0 % (Gemini 2.5 Flash) |
| Moderação em espanhol | É ofensivo? | 98,0 % | 98,5 % (GPT-4o mini e Llama 3.3 70B) |
| Sentimento em espanhol | Positivo, neutro ou negativo | 66,0 % | 75,0 % (Gemini 2.5 Flash) |
Três observações:
- Latência: Jev respondeu com uma mediana de cerca de 250 ms nos quatro conjuntos. Os quatro LLMs levaram entre 1 e 2,3 segundos.
- Custo: Jev foi o mais barato nos quatro conjuntos. No Banking77 custou cerca de 0,08 USD para cada 1.000 linhas, contra 0,28 USD do Gemini 2.5 Flash e 1,84 USD do Claude Haiku 4.5.
- Precisão: Jev não vence em tudo. Em classificação de intenção, spam e moderação fica a dois pontos ou menos do melhor LLM, e até mesmo à frente de alguns. Em sentimento em espanhol fica nove pontos atrás.
Esse último resultado é a razão de ser da ferramenta: uma média não diz como um modelo se comporta em sua tarefa.
E se você combinar Jev com um LLM?
Decisions também calcula uma estratégia combinada: Jev responde quando sua confiança supera um limiar e o resto das linhas passa para o LLM. A ferramenta recomenda esse limiar a partir dos dados.
Em sentimento em espanhol, essa combinação alcançou 74,5% de precisão enviando ao Gemini apenas 40,5% das linhas. Você obtém quase a precisão do LLM, com Jev resolvendo a maioria das linhas em sua velocidade e seu custo.
Como faço para testar com meus dados?
- Faça login em decisions.yodev.dev com sua conta da yoDEV. Se ainda não tem uma, o registro é gratuito.
- Conecte o OpenRouter para o lado do LLM e escolha qualquer um de seus modelos. Você paga essas chamadas com seu próprio saldo, ou escolhe um modelo gratuito. Sua chave do OpenRouter é salva em seu navegador.
- Escolha um conjunto predefinido ou faça upload de um CSV com uma coluna
texte uma colunalabelcom a resposta esperada: até 2.000 linhas. - Revise os resultados: precisão, calibração, custo, latência, as linhas em que os modelos não coincidem e a estratégia combinada recomendada. Cada execução é salva automaticamente em seu yoDEV Workplace.
Você pode formular a pergunta em inglês e em espanhol para medir a diferença. Jev foi treinado principalmente em inglês.
O que acontece com os dados que faço upload?
No Workplace são salvos apenas as métricas e os números das linhas, nunca o texto de suas linhas. As linhas que você faz upload são deletadas 30 dias depois de sua última execução com esse conjunto, e você pode deletá-las antes a qualquer momento.
E a Decisions API do OpenAI?
Em 29 de setembro de 2026, a OpenAI anunciou em sua DevDay uma Decisions API: um modelo que escolhe entre respostas predefinidas pelo desenvolvedor, em vez de gerar texto, a mesma categoria que Jev. Em 1º de outubro está em visualização limitada, sem referência pública da API, preços ou limites. Resumo do DevDay 2026
Que dois provedores apostem na mesma ideia confirma que as decisões limitadas estão se tornando uma peça própria das aplicações com IA. Também torna mais importante a pergunta de sempre: qual funciona melhor em sua tarefa? Quando essa API tiver acesso público, faz sentido medi-la com o mesmo método.
Que limites têm essas medições?
- São 200 linhas por conjunto e uma única execução por modelo, realizadas em 29 e 30 de setembro de 2026 com Jev 1.13.
- A latência depende de onde é medida. Meça a partir de sua própria região antes de tirar conclusões.
- A precisão do Banking77 e SMS spam é medida com textos em inglês; a de moderação e sentimento, com textos em espanhol.
- O conjunto de moderação contém linguagem ofensiva.
Cada página de resultados tem links para a fonte e para a licença de seu conjunto de dados.
yoDEV Decisions é uma ferramenta independente da yoDEV, sem afiliação com TypeSafe AI nem com OpenAI. Jev é um produto da TypeSafe AI.
