Claude Opus 5.5 rinde como Fable 5.1 y cuesta un 40% menos

Claude Opus 5.5 rinde como Fable 5.1 y cuesta un 40% menos
Fuente: anthropic.com

Anthropic ha lanzado hoy Claude Opus 5.5, el primer modelo de su nueva familia 5.5. Según la empresa rinde al nivel de Claude Fable 5.1 en la mayoría de tareas y cuesta un 40% menos de ejecutar que Opus 5 en cargas de trabajo típicas. Sonnet 5.5 y Haiku 5.5 llegarán "en las próximas semanas".

Es también el primer modelo que Anthropic saca desde que Dario Amodei pidió frenar el ritmo de la frontera, y lo presenta con una frase pensada para ese debate: lo han probado evaluadores externos antes de publicarlo.

Puntos clave

  • Precio: 4 dólares por millón de tokens de entrada y 20 por millón de salida, un 20% menos que Opus 5. La lectura de caché baja a 0,20 dólares, un 60% menos, y según Anthropic es la mayor parte del coste en trabajo con agentes y código.
  • Coste real: un 40% menos que Opus 5 a los ajustes por defecto, porque además de ser más barato por token usa menos tokens por tarea. Genera texto un 30% más rápido.
  • Rendimiento: 54,6% en FrontierCode a esfuerzo medio, por encima del 53,3% de GPT-6 Astra a su máximo y con una quinta parte del coste por tarea. En GDPval-AA v2.1, trabajo real de 44 profesiones, saca 1.846 Elo frente a 1.735 de Fable 5.1 y 1.708 de Opus 5.
  • Suscripciones: suben los límites de uso de cinco horas en los planes Pro, Max y Team, y los suscriptores reciben un reinicio de límites que pueden guardar y usar cuando quieran.

Lo que cambia en el bolsillo

Para quien paga la API, lo importante es la caché. En una sesión de Claude Code o de un agente, el modelo relee una y otra vez el mismo contexto (el repositorio, las instrucciones, el historial), y eso se factura como lectura de caché. Bajarla un 60% abarata justo la parte del trabajo que más pesa.

Los ejemplos que da Anthropic van en esa línea. Un cliente auditó y arregló una base de código de 200.000 líneas en menos de tres horas, cuando Opus 5 tardó más de 20 y gastó 2,5 veces más tokens. Otro completó una migración de 680.000 líneas en menos de un día. Y en una prueba interna, traducir HAProxy (el software que reparte tráfico web entre servidores) de C a Rust le llevó 9,5 horas a Opus 5.5 y 12 a Fable 5.1, con un 51% menos de coste. Las dos versiones pasaron casi todos los tests de regresión de HAProxy.

Hay también un modo rápido en Claude Code y en la plataforma de Claude, hasta 2,5 veces más veloz, a 8 y 40 dólares por millón de tokens.

Los benchmarks, con su letra pequeña

Anthropic dice que Opus 5.5 lidera en código con agentes, uso del ordenador y trabajo de conocimiento. En CursorBench, tareas ambiguas sacadas de sesiones reales de Cursor, marca 52,5% a esfuerzo medio, contra el 51,8% de Fable 5.1 a máximo esfuerzo y el 46,6% de Opus 5. En Terminal-Bench 4.0 iguala a GPT-6 Astra por cerca del 40% del coste.

Y la propia Anthropic rebaja las expectativas en el mismo anuncio: a estos niveles, dice, los márgenes en benchmarks son una guía cada vez menos fiable de las diferencias reales, y en su uso interno la distancia entre Opus 5.5 y Fable 5.1 es más pequeña de lo que dicen las cifras. Me parece la frase más honesta del anuncio. Lo que sí es medible y no depende de un test es el precio.

Escribe mejor, que era la queja

Anthropic reconoce que la forma de escribir de Opus 5 era una de las críticas más repetidas. Opus 5.5 pone lo importante al principio, usa menos jerga y sigue mejor las reglas de estilo que le das. Uno de los probadores lo resumió en una frase que Anthropic cita: escribe como él.

Los testimonios de empresas van del código a la consultoría. Deloitte, LexisNexis, Thomson Reuters o la gestora Walleye Capital aparecen en la lista. En Walleye, el modelo detectó que las propias instrucciones de su evaluación tenían un error de indexación por un minuto y lo corrigió, algo que ningún modelo había hecho antes según la firma. En una prueba de investigación de Anthropic con cifras comprobadas una a una, 16 de los 18 informes de Opus 5.5 pasaron el listón, donde una sola cifra o cita inventada suspendía.

El primer modelo después de "frenar la frontera"

Hace una semana Amodei propuso frenar de forma coordinada el desarrollo de modelos de frontera con evaluadores independientes. Opus 5.5 llega con esa pieza puesta: lo probaron antes del lanzamiento Frontier Design y METR, y Anthropic dice que es el modelo con mejor nota que ha medido en su auditoría automática de comportamiento, con menos tendencia a hacer cosas difíciles de deshacer o a salirse de los límites que le dan, y más resistente a la inyección de instrucciones que Opus 5.

Como iguala a Claude Mythos 5.1 en biología y ciberseguridad, sale con salvaguardas parecidas a las de Fable 5.1. Para investigación en biología hay que pedir acceso al programa de verificación de ciencias de la vida, y el programa equivalente de ciberseguridad se abrirá a más profesionales en las próximas semanas. Contamos cómo funcionaban esas capas en el lanzamiento de Fable 5.1 y Mythos 5.1.

El lanzamiento llega además el mismo día que Claude sufrió 80 minutos de errores en Opus 5, Fable y Mythos.

Por qué importa

Si tu empresa usa Claude por API, este es el cambio de modelo más fácil de justificar del año: mismo proveedor, rendimiento de la gama alta y una factura que baja. Yo haría una cosa antes de cambiar en producción, que es pasar tus diez tareas reales más frecuentes por Opus 5 y por Opus 5.5 y comparar coste y resultado, porque el 40% es la media de Anthropic y tu mezcla de tareas puede dar otra cifra.

Si lo usas con suscripción, el cambio se nota en los límites: más margen en la ventana de cinco horas y un reinicio guardado para el día que lo necesites. Y si tienes agentes largos con Claude Code, la rebaja de la caché es la que más vas a notar a final de mes.

Fuente original: Anthropic


Relacionado