Prueba Jev sin crear una cuenta: frente a LLM populares y un modelo de decisión abierto

Desde hoy puedes probar Jev en yoDEV Decisions sin crear una cuenta: eliges uno de los conjuntos de datos públicos y pulsas Iniciar ejecución. No hace falta registrarse, ni una cuenta de OpenRouter, ni una tarjeta: yoDEV paga las llamadas a Jev.

Tu cuenta de yoDEV, que es gratis, solo la necesitas cuando quieras usar tus propios datos.

Hasta ahora, para ver un solo resultado había que registrarse, crear una cuenta de OpenRouter y cargarle saldo. Ahora ninguno de esos pasos es obligatorio.

¿Qué es un modelo de decisión como Jev?

Un modelo de decisión no escribe texto: devuelve una respuesta tipada (sí/no, una opción de una lista o un nivel) junto con una probabilidad de que sea correcta. Jev es el modelo de decisión de TypeSafe AI. yoDEV Decisions mide cómo se comporta con datos reales, frente a las respuestas correctas y, si quieres, frente a un LLM, fila por fila. Lo explicamos a fondo en nuestro artículo sobre Jev.

¿Qué puedes hacer sin cuenta?

  • Ejecutar Jev en los cuatro conjuntos de datos públicos, hasta 5 veces al día.
  • Ver sus resultados frente a las respuestas correctas:
    • exactitud;
    • calibración, en un diagrama de fiabilidad: si Jev dice estar seguro al 90 , ¿acierta el 90 de las veces? Es lo que te permite decidir cuándo confiar en su respuesta y cuándo revisarla;
    • latencia (mediana y percentil 95);
    • costo por cada 1.000 decisiones.
  • Compararlo con un LLM, si quieres. Marca «Comparar también con un LLM» y elige cualquier modelo de OpenRouter. Se ejecuta desde tu navegador con tu propia clave, y Decisions compara ambos fila por fila.

Las ejecuciones sin cuenta se borran a los 7 días. Si después creas tu cuenta o inicias sesión, pasan a tu cuenta y se conservan.

¿Y con tu cuenta de yoDEV?

  • Subes tus propios datos: un CSV con una columna text y una columna label con la respuesta que esperas, hasta 2.000 filas.
  • Tienes 5.000 filas al mes con Jev, y puedes pedir más desde la propia herramienta.
  • Tus ejecuciones se guardan en tu cuenta y, si quieres, como informe en tu yoDEV Workplace.

¿Cómo se compara Jev con un modelo de decisión abierto?

Decider 2B igualó o superó a Jev en exactitud en los cuatro conjuntos públicos, pero es mucho más lento sin GPU. En las páginas de resultados añadimos un tercer participante junto a Jev y los LLM: Decider 2B, un modelo de decisión abierto de Mapika, basado en Qwen3.5 y con licencia Apache-2.0. Lo ejecutamos en nuestros propios servidores con Ollaya, sobre las mismas 200 filas y con la misma pregunta en español que Jev.

Conjunto Jev Decider 2B
Banking77: intención bancaria, 77 opciones 82,0 % 87,0 %
Sentimiento en español 66,0 % 70,5 %
SMS spam 97,0 % 97,5 %
Moderación en español 98,0 % 98,0 %

Su calibración también fue mejor en 6 de las 8 mediciones: los cuatro conjuntos, con la pregunta en español y en inglés.

La otra cara es la velocidad. En nuestros servidores, sin GPU, Decider 2B tardó una mediana de 4 a 5 segundos por fila, y unos 19 segundos en Banking77. Jev respondió en unos 250 ms. Con GPU la diferencia sería mucho menor, pero hoy no podemos ofrecer Decider 2B para ejecutarlo en vivo con tiempos razonables. Por eso, por ahora, solo aparece en los resultados públicos.

Lo que muestra es interesante para cualquier equipo: un modelo abierto de 2.000 millones de parámetros, que puedes alojar tú mismo, compite de igual a igual en tareas de decisión acotadas.

¿Qué pasa con los datos?

  • Sin cuenta: solo se usan los conjuntos de datos públicos. Tus ejecuciones se asocian a un identificador aleatorio guardado en una cookie de tu navegador, sin tu IP ni ningún dato personal.
  • Con cuenta: las filas que subes se eliminan 30 días después de tu última ejecución con ese conjunto, y puedes eliminarlas antes en cualquier momento. Si guardas un informe en tu Workplace, solo incluye las métricas y los números de fila, nunca el texto de tus filas.

¿Qué límites tienen estas mediciones?

  • Son 200 filas por conjunto y una sola ejecución por modelo.
  • La latencia de Decider 2B se midió en CPU, sin GPU. La de Jev incluye el tiempo de red hasta OpenRouter.
  • Banking77 y SMS spam tienen textos en inglés; moderación y sentimiento, en español.

yoDEV Decisions es una herramienta independiente de yoDEV, sin afiliación con TypeSafe AI ni con Mapika. Jev es un producto de TypeSafe AI.


¿Y tú? ¿Qué decisión de tu producto le confiarías a un modelo de decisión en lugar de a un LLM?

¿Qué usas hoy para clasificar textos (intención, spam, sentimiento, moderación)?
  • Un LLM general (GPT, Gemini, Claude…)
  • Un modelo de decisión o un clasificador dedicado
  • Reglas o un modelo entrenado por nuestro equipo
  • Prefiero otra opción (cuéntanos cuál)
0 votantes

Comenta abajo o, si este artículo te llegó por correo, responde directamente al email: tu respuesta se publica aquí.

Relacionado: Jev de TypeSafe: cómo funciona la IA que toma decisiones sin generar texto