Cuánto cuesta Claude Code frente a SWE-2, el nuevo modelo de Devin

SWE-2, el nuevo modelo de Cognition, saca 50.0% en FrontierCode 1.1 Main frente al 50.9% de Fable 5.1: nueve décimas de diferencia, con un costo 64% menor. Ese es todo el argumento, y si se sostiene o no depende de un número que Cognition publica sin detenerse en él.

SWE-2 salió el 10 de septiembre de 2026, post-entrenado a partir de Kimi K3, el modelo de 2.8 billones de parámetros de Moonshot cuyos pesos abiertos cubrimos cuando aterrizó. Está disponible desde el día del anuncio en Devin Desktop y en la CLI de Devin, con despliegue en curso hacia Devin Web y Fusion.

¿Qué es SWE-2 y qué es Devin?

SWE-2 es un modelo de código, no una herramienta de código. No instalas SWE-2: instalas Devin, el producto de coding agéntico de Cognition, y seleccionas SWE-2 dentro de él. La distinción importa más aquí que con otros modelos, porque SWE-2 no tiene API pública ni pesos abiertos. La CLI de Devin, la aplicación de escritorio, la interfaz web y Fusion son los únicos lugares donde corre.

Devin es un agente que toma una tarea, la planifica, edita archivos, ejecuta comandos e itera. La misma categoría que Claude Code o el modo agente de Cursor, con más del bucle oculto detrás del producto. Tiene un plan gratuito, un plan Pro de 20 dólares al mes y un plan Max de 200 dólares al mes, además de precios por equipo de 80 dólares mensuales por el equipo más 40 dólares por asiento de desarrollador.

¿Por qué el nivel barato dejó de ser el nivel tonto?

Esta es la parte realmente nueva, y es un resultado de entrenamiento antes que una decisión de producto.

La mayoría de los modelos que ofrecen niveles de esfuerzo de razonamiento los consiguen entrenando un modelo y variando después cuánto se le permite pensar en tiempo de inferencia, o entrenando cada nivel por separado. El algoritmo de RL de Cognition entrena los tres niveles de esfuerzo en una sola corrida, con una función de recompensa penalizada por costo donde el peso de la penalización corresponde a la pendiente local de la frontera de Pareto costo-rendimiento en cada nivel. En términos llanos: cada nivel se optimiza contra lo que vale un token en ese nivel, dentro del mismo pase de entrenamiento. Cognition también reporta un “length-weighted reward baseline” que estabiliza el entrenamiento sin cómputo adicional.

La consecuencia observable es de comportamiento. SWE-2 medium hace su primera edición real de archivo tras una mediana de 18 pasos. SWE-1.7 necesitaba 48. Pasos promedio por corrida en FrontierCode 1.1 Main:

Modelo Pasos promedio
SWE-1.7 127
SWE-2 medium 53
SWE-2 high 80
SWE-2 max 98

Frente a su propio predecesor, SWE-2 medium puntúa más alto tomando 58% menos turnos y costando 81% menos en promedio. El nivel barato dejó de dar vueltas antes de ponerse a trabajar: eso es lo que compra entrenar los niveles de esfuerzo en una sola corrida.

¿Cuánto cuesta Claude Code frente a SWE-2?

Aquí hay que leer con cuidado, porque la comparación cambia dos veces.

Hoy, hasta el 10 de octubre de 2026, SWE-2 es gratis en el plan Pro de 20 dólares al mes: Cognition lista “free SWE-2 and open source models through October 10, 2026” como beneficio de Pro. Durante esa ventana, la pregunta del costo tiene una respuesta trivial para cualquier desarrollador individual: 20 dólares mensuales planos, sin medición por token sobre SWE-2. Nada con cobro por uso compite con eso.

Después de esa fecha, vuelves a la comparación publicada: 64% más barato que Fable 5.1 por una diferencia de 0.9 puntos en el benchmark, y aproximadamente un cuarto del costo de GPT-6 Astra. Cognition aclara que estas cifras usan precios de lista, incluidos los descuentos públicos.

Dos cosas que conviene retener. Primero, cada una de esas cifras es de Cognition, medida sobre el benchmark de Cognition: FrontierCode es su propio arnés. Que sea autorreportado no lo vuelve falso, pero tampoco lo vuelve validado de forma independiente. Segundo, la fecha de la promoción es la parte que sostiene la respuesta del costo en este momento, y está a cuatro semanas de esta publicación.

¿Dónde falla SWE-2?

En Terminal-Bench 4. SWE-2 saca 27.3%; Fable 5.1 saca 55.8%. Cognition lo publica sin comentario.

La brecha se pone más interesante junto al otro número del mismo post: 92.8% en Terminal-Bench 2.1. Un modelo que supera el 92.8% en el benchmark antiguo y se queda en 27.3% en el nuevo está diciendo algo sobre generalización, y la discusión en Hacker News aterrizó exactamente en esa lectura. El contraargumento —que TB2.1 está saturado y la comparación es injusta— es razonable, pero se debilita cuando modelos más antiguos puntúan por encima de SWE-2 en TB4.

La comparación que debería preocupar más a Cognition: DeepSeek v4.1 Flash puntúa, según los datos citados en esa discusión, 31.2% en Terminal-Bench 4, por encima de SWE-2, a un costo de API drásticamente menor y con pesos abiertos. Si tu razón para mirar SWE-2 es el costo por tarea, esa es la alternativa contra la que hay que ponerle precio. Y a diferencia de SWE-2, no exige adoptar un producto de agente nuevo solo para evaluarla.

¿Cómo se instala?

La CLI de Devin se instala con un comando:

curl -fsSL https://cli.devin.ai/install.sh | bash

SWE-2 también está en Devin Desktop desde el día del lanzamiento, y en despliegue hacia Devin Web y Fusion.

Una advertencia que conviene conocer antes de ir a buscar: al momento de publicar esta nota, devin.ai/cli todavía anunciaba “Opus 4.7, GPT 5.5, and SWE-1.6” en su lista de modelos. Las páginas del día del anuncio van por detrás de los modelos del día del anuncio. Cognition no ha publicado una página de configuración dedicada a SWE-2, así que si necesitas fijar el modelo explícitamente en lugar de elegirlo en la interfaz, revisa la salida de ayuda de la propia CLI antes que cualquier guía escrita esta semana.

¿Conviene cambiarse?

Pruébalo si ya pagas Devin, o si la ventana gratuita hasta octubre hace que evaluarlo no te cueste más que tiempo. Para cuatro semanas, es un buen trato.

No te cambies por la tabla de benchmarks. El resultado de eficiencia es real y está bien documentado: menos turnos, primera edición más rápida, corridas más baratas, y un método de entrenamiento que explica el porqué en lugar de limitarse a afirmarlo. La afirmación de paridad con la frontera es más delgada: 0.9 puntos en el benchmark del propio proveedor, socavados por un déficit de 28 puntos en otro benchmark que ese mismo proveedor publica. Y toda la comparación es una foto del momento: expira con el próximo lanzamiento de frontera, que históricamente se mide en semanas.

Lo que hay que llevarse de este lanzamiento no es la posición en el ranking. Es que entrenar los niveles de esfuerzo de forma conjunta, contra lo que vale un token en cada nivel, volvió competente al nivel barato. Esa técnica va a aparecer en los modelos de otros, y va a importar más tiempo que el lugar de SWE-2 en cualquier tabla.

Claude Code precio agentes-de-codigo devin kimi benchmarks