Teste Jev sem criar uma conta: comparado com LLMs populares e um modelo de decisão aberto

A partir de hoje você pode testar o Jev no yoDEV Decisions sem criar uma conta: escolha um dos conjuntos de dados públicos e clique em Iniciar execução. Não é preciso se cadastrar, nem ter uma conta no OpenRouter, nem um cartão: o yoDEV paga as chamadas ao Jev.

Sua conta do yoDEV, que é gratuita, só é necessária quando você quiser usar seus próprios dados.

Até agora, para ver um único resultado era preciso se cadastrar, criar uma conta no OpenRouter e adicionar saldo. Agora nenhum desses passos é obrigatório.

O que é um modelo de decisão como o Jev?

Um modelo de decisão não escreve texto: ele devolve uma resposta tipada (sim/não, uma opção de uma lista ou um nível) junto com a probabilidade de ela estar correta. O Jev é o modelo de decisão da TypeSafe AI. O yoDEV Decisions mede como ele se comporta com dados reais, em comparação com as respostas corretas e, se você quiser, com um LLM, linha por linha. Explicamos tudo em detalhes no nosso artigo sobre o Jev.

O que você pode fazer sem conta?

  • Executar o Jev nos quatro conjuntos de dados públicos, até 5 vezes por dia.
  • Ver os resultados dele em comparação com as respostas corretas:
    • acurácia;
    • calibração, em um diagrama de confiabilidade: se o Jev diz ter 90% de certeza, ele acerta 90% das vezes? É isso que permite decidir quando confiar na resposta dele e quando revisá-la;
    • latência (mediana e percentil 95);
    • custo a cada 1.000 decisões.
  • Compará-lo com um LLM, se quiser. Marque “Comparar também com um LLM” e escolha qualquer modelo do OpenRouter. Ele é executado a partir do seu navegador com a sua própria chave, e o Decisions compara os dois linha por linha.

As execuções sem conta são apagadas após 7 dias. Se depois você criar sua conta ou fizer login, elas passam para a sua conta e são mantidas.

E com a sua conta do yoDEV?

  • Você envia seus próprios dados: um CSV com uma coluna text e uma coluna label com a resposta esperada, até 2.000 linhas.
  • Você tem 5.000 linhas por mês com o Jev, e pode pedir mais pela própria ferramenta.
  • Suas execuções ficam salvas na sua conta e, se quiser, como relatório no seu yoDEV Workplace.

Como o Jev se compara com um modelo de decisão aberto?

O Decider 2B igualou ou superou o Jev em acurácia nos quatro conjuntos públicos, mas é muito mais lento sem GPU. Nas páginas de resultados adicionamos um terceiro participante ao lado do Jev e dos LLMs: o Decider 2B, um modelo de decisão aberto da Mapika, baseado no Qwen3.5 e com licença Apache-2.0. Nós o executamos em nossos próprios servidores com o Ollaya, sobre as mesmas 200 linhas e com a mesma pergunta em espanhol usada com o Jev.

Conjunto Jev Decider 2B
Banking77: intenção bancária, 77 opções 82,0% 87,0%
Sentimento em espanhol 66,0% 70,5%
SMS spam 97,0% 97,5%
Moderação em espanhol 98,0% 98,0%

Sua calibração também foi melhor em 6 das 8 medições: os quatro conjuntos, com a pergunta em espanhol e em inglês.

O outro lado é a velocidade. Em nossos servidores, sem GPU, o Decider 2B levou uma mediana de 4 a 5 segundos por linha, e cerca de 19 segundos no Banking77. O Jev respondeu em cerca de 250 ms. Com GPU a diferença seria muito menor, mas hoje não conseguimos oferecer o Decider 2B para execução ao vivo com tempos razoáveis. Por isso, por enquanto, ele só aparece nos resultados públicos.

O que isso mostra é interessante para qualquer equipe: um modelo aberto de 2 bilhões de parâmetros, que você mesmo pode hospedar, compete de igual para igual em tarefas de decisão bem delimitadas.

O que acontece com os dados?

  • Sem conta: apenas os conjuntos de dados públicos são usados. Suas execuções ficam associadas a um identificador aleatório salvo em um cookie do seu navegador, sem o seu IP nem nenhum dado pessoal.
  • Com conta: as linhas que você envia são excluídas 30 dias após a sua última execução com esse conjunto, e você pode excluí-las antes a qualquer momento. Se você salvar um relatório no seu Workplace, ele inclui apenas as métricas e os números das linhas, nunca o texto das suas linhas.

Quais são os limites dessas medições?

  • São 200 linhas por conjunto e uma única execução por modelo.
  • A latência do Decider 2B foi medida em CPU, sem GPU. A do Jev inclui o tempo de rede até o OpenRouter.
  • Banking77 e SMS spam têm textos em inglês; moderação e sentimento, em espanhol.

O yoDEV Decisions é uma ferramenta independente do yoDEV, sem afiliação com a TypeSafe AI nem com a Mapika. O Jev é um produto da TypeSafe AI.


E você? Que decisão do seu produto você confiaria a um modelo de decisão em vez de a um LLM?

O que você usa hoje para classificar textos (intenção, spam, sentimento, moderação)?
  • Um LLM geral (GPT, Gemini, Claude…)
  • Um modelo de decisão ou um classificador dedicado
  • Regras ou um modelo treinado pela nossa equipe
  • Prefiro outra opção (conte qual)
0 votantes

Comente abaixo ou, se este artigo chegou até você por e-mail, responda diretamente ao e-mail: sua resposta será publicada aqui.

Relacionado: Jev da TypeSafe: como funciona a IA que toma decisões sem gerar texto