Claude Sonnet 5.5 vs Opus 5.5: en Claude Code, elegir modelo ya es una decisión de costos

Claude Sonnet 5.5, lanzado por Anthropic el 28 de septiembre, queda a unos dos puntos de Opus 5.5 en la mayoría de sus benchmarks y cuesta la mitad. Eso convierte la elección de modelo en Claude Code en una decisión de costos, no de capacidad. Pero la mitad del precio no es la mitad del costo, y en esa diferencia está la decisión real.

Un dato de contexto antes de los números: Claude Code no usa Sonnet por defecto. En los planes Pro, Max, Team y Enterprise, y en la API de Anthropic, el modelo default es Opus 5.5. Así que la pregunta que la mayoría de los equipos se hace esta semana no es “¿con qué modelo empiezo?”, sino “¿vale la pena bajar de Opus, y para qué trabajo?”.

¿Qué es Claude Sonnet 5.5?

Claude Sonnet 5.5 es el segundo modelo de la familia Claude 5.5 de Anthropic, pensado como el complemento más rápido y barato de Opus 5.5. Anthropic dice que su punto fuerte son las “tareas cotidianas bien acotadas, la corrección de bugs y la creación de documentos pulidos”, y que frente a Sonnet 5 “runs 30%+ faster, and costs up to 30% less for most work”.

Salió disponible para todos el mismo día del anuncio: en la Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry y Claude Platform on AWS. El ID del modelo es claude-sonnet-5-5, con ventana de contexto de 1M de tokens, salida máxima de 128K, conocimiento hasta junio de 2026 y retiro no antes del 28 de septiembre de 2027.

Anthropic anunció un tercer modelo, Haiku 5.5, para “las próximas semanas”. Al momento de publicar esta nota, todavía no está disponible.

Claude Sonnet vs Opus: ¿qué tan cerca está Sonnet 5.5 de Opus 5.5?

Muy cerca según la tabla de la propia Anthropic, e incluso por delante en un benchmark de programación. Todas las cifras son reportadas por Anthropic; todavía no hay replicación independiente.

Benchmark Sonnet 5.5 Opus 5.5 Sonnet 5
Terminal-Bench 4.0 (agentic coding) 70,6 % 66,4 %¹ 10,3 %
CursorBench 4.0 55,5 % 57,8 % 34,1 %
FrontierCode 1.1 (Main) 52,1 % (Xhigh) 54,4 % 42,4 %
GDPval-AA v2.1² 1844 1846 1449
OSWorld 2.1 (computer use) 80,1 % 81,8 % 57,0 %

¹ Opus 5.5 reportado en esfuerzo Xhigh, su mejor puntaje. ² GDPval-AA lo corrió Artificial Analysis sobre un despliegue previo al lanzamiento que, según Anthropic, tenía un bug de structured outputs ya corregido.

El salto en Terminal-Bench, de 10,3 a 70,6 , es el titular, y es la cifra que convierte a Sonnet 5.5 en una opción seria dentro de un agente de terminal. Sonnet 5 no lo era.

Pero Anthropic es inusualmente directa sobre el límite. El anuncio dice que los benchmarks “capture only one facet” y que “Opus 5.5 remains clearly stronger at complex, open-ended work requiring sustained judgment”. El system card va más allá: Sonnet 5.5 “usually does not reach the level of Opus 5.5”. Yo leo la tabla como “Sonnet 5.5 ya puede hacer casi todo lo que hace Opus en tareas bien definidas”, no como “Sonnet 5.5 es igual a Opus”.

¿Cuál es el precio de Claude Sonnet 5.5 frente a Opus?

La mitad, en casi todas las líneas de la lista de precios:

Por 1M de tokens Sonnet 5.5 Opus 5.5
Input $2 $4
Output $10 $20
Escritura en caché $2,50 $5
Lectura de caché $0,20 $0,20

La última fila es la que importa. La lectura de caché cuesta lo mismo en los dos modelos. Y una sesión de agentic coding es, sobre todo, lectura de caché: cada turno reenvía la conversación, el contexto del repositorio y los resultados de las herramientas, y casi todo vuelve desde la caché.

Un turno ilustrativo (mi aritmética, no una medición): 100K tokens leídos de caché, 5K de input nuevo y 2K de output.

  • Opus 5.5: $0,020 caché + $0,020 input + $0,040 output = $0,080
  • Sonnet 5.5: $0,020 caché + $0,010 input + $0,020 output = $0,050

Eso es cerca de 37 más barato, no 50 . Cuanto más larga la sesión y más grande el contexto en caché, más se acercan los dos. El ahorro que sobrevive está en los tokens de salida, y por eso la eficiencia de tokens de Sonnet 5.5 pesa más que su precio de lista.

Los gráficos de costo por tarea de Anthropic apuntan en la misma dirección. En sus palabras, Sonnet 5.5 “complements Opus 5.5 best when running at lower effort settings, where it costs less per task. At higher settings, it can perform comparably at a similar cost”. Dicho de otra forma: si corres Sonnet 5.5 en Xhigh para igualar a Opus, en buena parte vuelves a pagar la factura de Opus.

¿Cuál es el mejor modelo de Claude para programar: Sonnet 5.5 u Opus 5.5?

Mi lectura, para un equipo que ya trabaja con Claude Code:

  • Mantén Opus 5.5 como default para el trabajo ambiguo: decisiones de arquitectura, debugging sin causa clara, cambios en varios repositorios, cualquier cosa en la que querrías que un ingeniero senior te contradiga. Es exactamente la categoría que, según Anthropic, Opus sigue dominando.
  • Pasa el trabajo bien acotado a Sonnet 5.5 en esfuerzo medium: implementar una feature especificada, corregir un bug con reproducción conocida, escribir tests, refactors con un objetivo claro. Ahí se nota la velocidad y la diferencia de costo es mayor.
  • Considera opusplan, un modo de Claude Code que usa Opus en plan mode y cambia a Sonnet para la ejecución. Es la forma más limpia de aplicar esa división sin pensarlo en cada tarea.
  • Para cargas de trabajo por API fuera de Claude Code (bots de review, pipelines batch, agentes en CI), Sonnet 5.5 pasa a ser el primer candidato obvio. CodeRabbit, citado por Anthropic, dice que planea “move simple and moderate reviews over now”. Es un testimonio de cliente publicado por el propio proveedor, así que pésalo como tal, pero es el patrón que yo esperaría.

El punto estratégico para CTOs es que la decisión del modelo por defecto cambió de categoría. En la generación anterior, Sonnet era la opción económica en la que aceptabas perder calidad. En esta, la brecha en trabajo acotado es tan pequeña que elegir modelo se vuelve una política de enrutamiento, y las políticas de enrutamiento van en las convenciones del equipo, no en los hábitos de cada desarrollador.

Si tu equipo además compara agentes, el mismo razonamiento aplica entre proveedores: lo vimos en Claude Code vs Codex y en el lanzamiento de Gemini 3.7 Flash.

¿Cómo usar Sonnet 5.5 en Claude Code?

Sonnet 5.5 requiere Claude Code v2.1.284 o superior; primero ejecuta claude update. Después:

  • Dentro de una sesión: /model sonnet
  • Al iniciar: claude --model sonnet
  • Esfuerzo: /effort (en Claude Code, Sonnet 5.5 usa medium por defecto, igual que Opus 5.5)

Ojo: /model guarda tu elección como default para las sesiones nuevas. Para cambiar solo en la sesión actual, abre el selector con /model y presiona s sobre la fila del modelo.

Un detalle para lectores enterprise: el alias sonnet solo apunta a Sonnet 5.5 en la API de Anthropic. Al momento de publicar esta nota, apunta a Sonnet 4.5 en Amazon Bedrock y Google Cloud, y a Sonnet 4.6 en Claude Platform on AWS. En esos proveedores, selecciona el modelo de forma explícita o fíjalo con ANTHROPIC_DEFAULT_SONNET_MODEL.

¿Sonnet 5.5 rechaza tareas de ciberseguridad?

Más que Sonnet 5. Sonnet 5.5 es el primer Sonnet que sale con salvaguardas de ciberseguridad similares a las de Opus 5.5, y el system card de Anthropic lo dice sin rodeos: “users should expect increased refusals with Sonnet 5.5, even on benign cybersecurity-related tasks”. En Claude Code, las solicitudes marcadas por ciberseguridad pasan automáticamente a Sonnet 5; las marcadas por biología terminan en rechazo, sin modelo de respaldo. Si tu equipo hace investigación de seguridad, fuzzing o análisis de binarios, pruébalo antes de cambiar.

¿Qué cambia para un equipo técnico?

Sonnet 5.5 no reemplaza a Opus 5.5. Lo que hace es que valga la pena responder con intención la pregunta “¿qué modelo?”. En tareas acotadas y con esfuerzo medium es más rápido y bastante más barato. En sesiones largas y cargadas de caché, el ahorro se reduce, y en trabajo abierto que exige criterio, la propia Anthropic dice que Opus sigue adelante. Trátalo como una decisión de enrutamiento, deja la regla por escrito y revísala cuando llegue Haiku 5.5.