Microsoft-Decision-1 vs Jev: en qué se diferencian los modelos de decisión y cuándo usar cada uno

Microsoft-Decision-1 y Jev cuestan exactamente lo mismo, 0,042 dólares por millón de tokens de entrada y salida gratis, así que elegir entre ellos depende del contexto, el versionado, la documentación y la precisión con tus propios datos. Microsoft lanzó su modelo de decisión (decision model) el 9 de octubre de 2026, disponible ese mismo día en Microsoft Foundry y en OpenRouter, y entra en una categoría que Jev, de TypeSafe, lidera desde septiembre.

¿Qué es Microsoft-Decision-1?

Microsoft-Decision-1 es un modelo pequeño de decision scoring: le das un conjunto fijo de opciones y devuelve una probabilidad calibrada para cada una, no texto. Microsoft lo construyó con un post-entrenamiento de Qwen3.5-9B para puntuar en una sola pasada, y admite preguntas de sí/no, opción múltiple y valoración, además de calificar con rúbrica respuestas de IA y acciones de agentes. Microsoft lo orienta a enrutamiento, clasificación, priorización, verificación y control de agentes. La página del modelo en OpenRouter es explícita sobre lo que no hace: generación abierta, conversación, traducción ni resúmenes.

Si la categoría es nueva para ti, explicamos cómo funciona un modelo de decisión, y por qué no es un LLM con un esquema JSON, en Jev de TypeSafe: cómo funciona la IA que toma decisiones sin generar texto.

¿En qué se diferencia Microsoft-Decision-1 de Jev?

Tienen el mismo precio y casi todo lo demás es distinto.

Microsoft-Decision-1 Jev 1.13
Fabricante Microsoft TypeSafe
Lanzamiento 9 oct 2026 18 sep 2026 (ficha en OpenRouter)
Precio de entrada 0,042 USD / 1M tokens 0,042 USD / 1M tokens
Precio de salida Gratis Gratis
Contexto 33K 64K por petición (32K para state + la pregunta más larga)
Modelo base Qwen3.5-9B post-entrenado (se cambiará) No publicado
Versionado Pesos actualizados de forma continua, misma forma de API ID versionado jev-1.13.0, más el alias jev-latest
Dónde se usa Microsoft Foundry, OpenRouter (servido por Azure) API de TypeSafe, OpenRouter (servido por TypeSafe)
Documentación de la API Sin esquema de petición publicado Quickstart con esquema completo de petición y respuesta
Latencia P50 en OpenRouter 0,21 s 0,19 s

Precios, contexto y latencia según OpenRouter y la documentación de TypeSafe al 10 de octubre de 2026. La latencia es la medición en vivo de OpenRouter y cambia a diario.

¿Microsoft-Decision-1 es más rápido que Jev?

Con los datos disponibles hoy, no: en la medición en vivo de OpenRouter ambos rondan los 0,2 segundos de mediana, con Jev apenas por delante. Los benchmarks de Microsoft sitúan a Microsoft-Decision-1 unas 35 veces más rápido que GPT-6 Sol y 2,5 veces más rápido que H2O-Lightning-4B, el segundo de su comparación, pero son mediciones de Microsoft, no reproducidas de forma independiente. Microsoft dice que también evaluó a Jev en precisión y calibración (lo indica una nota del editor en el anuncio), pero al momento de publicar esta nota esas cifras solo aparecen como imágenes en el post, sin una versión en texto que pudiéramos verificar y citar.

El resto de las afirmaciones también son de Microsoft: la mayor precisión en 36 benchmarks y casi 150.000 preguntas excluidas del entrenamiento, y decisiones que cambian solo en el 1,3 por ciento de las entradas reformuladas o reordenadas. Internamente, Microsoft cuenta que Xbox Research lo usó para clasificar más de 10.000 comentarios de jugadores por temas, con una calidad competitiva frente a GPT-6 Sol, más de 14 veces más rápido y por una fracción del costo.

¿Cómo se usa Microsoft-Decision-1 en OpenRouter?

Se usa a través de la Decisions API de OpenRouter, no del endpoint de chat completions: OpenRouter advierte que los SDK de chat completions no funcionan con este modelo. En los SDK de OpenRouter (Python, TypeScript y Go) la llamada está en alpha.decisions.create y recibe tres parámetros obligatorios: model, questions y state. El identificador del modelo es microsoft/microsoft-decision-1. El espacio alpha indica que la propia API todavía es preliminar.

Al 10 de octubre de 2026, ni Microsoft ni OpenRouter habían publicado el esquema de questions ni el del objeto de respuesta para Microsoft-Decision-1, así que no reproducimos una petición aquí: un esquema adivinado fallaría en silencio para cualquiera que lo copie.

La forma de la petición de Jev, en cambio, está documentada en el quickstart de TypeSafe. state contiene el texto que se evalúa y questions es un mapa de nombres que eliges a preguntas tipadas: choice (elige una opción etiquetada), score (valora en una escala ordenada) o noul (un valor de tipo sí/no):

{
  "model": "jev-latest",
  "state": "The deploy failed on the payments service and customers cannot check out.",
  "questions": {
    "urgency": {
      "type": "noul",
      "instructions": "Does this message describe an incident that needs immediate attention?"
    }
  }
}

La petición va a POST https://api.typesafe.ai/v1/systemone con un bearer token. La respuesta devuelve un objeto answers con una clave por cada pregunta, con la opción o la puntuación, un valor confidence y las probabilities por opción.

Los dos modelos comparten la misma idea en tres partes (un state, preguntas con nombre, probabilidades de vuelta), así que es probable que cambiar uno por otro dentro de la Decisions API de OpenRouter sea barato. Hasta que Microsoft documente sus tipos de pregunta, “probable” es lo más lejos que llegamos.

¿Cuánto cuesta Microsoft-Decision-1 frente a Jev?

Grego: Con precios de lista idénticos, el costo deja de diferenciar a uno de otro y pasa a ser el argumento a favor de la categoría. La salida es gratis y una decisión ocupa unos pocos tokens de todos modos, así que pagas por lo que envías. A 0,042 dólares por millón de tokens de entrada, un millón de decisiones con entradas de 500 tokens cuesta unos 21 dólares, en cualquiera de los dos. Para un CTO, la pregunta de costo real no es la factura, sino a qué renuncias. Jev te permite fijar jev-1.13.0 y saber que el modelo detrás de tu enrutador no va a cambiar sin aviso. Microsoft-Decision-1 te dice lo contrario a propósito: los pesos se actualizan de forma continua y la base pasará de Qwen3.5-9B a modelos de MAI y OpenAI “pronto”. Si tus decisiones alimentan un registro de auditoría o un control de cumplimiento, esa diferencia pesa más que cualquier benchmark. Si tu stack ya corre en Azure y compras prefiere un solo proveedor, Foundry es el mejor argumento a favor de Microsoft.

¿Cuándo usar un modelo de decisión en lugar de un LLM?

Cuando tu software ya conoce las respuestas posibles y solo necesita elegir, puntuar o aprobar una. Enrutar una petición a un modelo o a un equipo, etiquetar comentarios, comprobar si la siguiente acción de un agente debe continuar, filtrar contenido, calificar una respuesta de IA con una rúbrica: todo eso son decisiones, y un modelo de decisión te devuelve una probabilidad a la que puedes aplicar un umbral en lugar de texto que tienes que parsear. Para tareas de modelo de clasificación con etiquetas fijas, es la herramienta natural. Usa un LLM cuando el resultado es el propio texto o cuando no conoces las opciones de antemano.

Dentro de la categoría, elige según la restricción:

  • Entradas largas (logs, tickets extensos, conversaciones completas): los 64K de Jev frente a los 33K de Microsoft-Decision-1.
  • Necesitas un modelo estable detrás de una decisión que quizá debas explicar después: los IDs versionados de Jev.
  • Organizaciones que trabajan sobre Azure: Microsoft-Decision-1 a través de Foundry.
  • Contenido en español: ninguno de los dos proveedores garantiza paridad con el inglés. TypeSafe indica que Jev logra su mejor precisión en inglés; Microsoft dice que sus benchmarks incluyen tareas multilingües. Pruébalo con tu propio texto.

¿Qué otros modelos de decisión hay en OpenRouter?

Microsoft y TypeSafe no están solos. El ranking de modelos de decisión de OpenRouter de la semana al 9 de octubre de 2026 muestra a Jev 1.13 muy por delante en volumen, seguido por recién llegados como GPT-6 Luna Decisions de OpenAI, Clef y Clef Flash de Cloudflare, Decider de Perplexity y d1 de Liquid. Microsoft-Decision-1 todavía no aparecía entre los diez primeros en esa fecha: llevaba un día disponible. Que dos de los mayores laboratorios de IA lancen APIs de decisión con semanas de diferencia es una señal razonable de que el modelo de decisión se está convirtiendo en una capa estándar de los stacks de agentes, no en un nicho de TypeSafe.

¿Cómo probar un modelo de decisión con tus propios datos?

La precisión en el benchmark de otro dice poco sobre tus etiquetas. yoDEV Decisions ejecuta Jev sobre datasets públicos o tu propio CSV y reporta precisión, calibración, latencia y costo por mil decisiones. Nuestra primera ronda de resultados comparó Jev con un modelo de decisión abierto en cuatro datasets, dos de ellos en español. Al 10 de octubre de 2026, Microsoft-Decision-1 todavía no está en la herramienta; cuando lo enfrentemos a Jev, agregaremos los resultados aquí.


¿Y tú? ¿Qué decisión de tu aplicación le quitarías hoy a un LLM para dársela a un modelo de decisión?

¿Qué modelo de decisión probarías primero?
  • Jev
  • Microsoft-Decision-1
  • Un modelo abierto en local
  • Prefiero otra opción (cuéntanos cuál)
0 votantes

Comenta abajo o, si este artículo te llegó por correo, responde directamente al email: tu respuesta se publica aquí.

Relacionado: Jev de TypeSafe: cómo funciona la IA que toma decisiones sin generar texto