Anthropic ha lanzado hoy Claude Sonnet 5.5, su modelo intermedio, con el mismo precio por token que Sonnet 5 y dos promesas: genera texto más de un 30% más rápido y cuesta hasta un 30% menos por tarea, porque necesita bastantes menos tokens para hacer el mismo trabajo. Ya está en Claude.ai (web, iOS y Android), en Claude Code y en la API.
Es el segundo modelo de la familia 5.5, una semana después de Opus 5.5. Haiku 5.5, el pequeño, llegará "en las próximas semanas", sin fecha.
Puntos clave
- Precio: 2 dólares por millón de tokens de entrada, 10 por millón de salida y 0,20 por millón en lectura de caché. Idéntico a Sonnet 5. La escritura en caché sale a 2,50, la mitad que en Opus 5.5.
- Coste real: hasta un 30% menos por tarea que Sonnet 5 en las pruebas de Anthropic, porque gasta menos tokens para llegar al mismo resultado.
- Velocidad: genera la salida más de un 30% más rápido que Sonnet 5. Anthropic dice que es su Sonnet más rápido hasta ahora.
- Rendimiento: 70,6% en Terminal-Bench 4.0 (código con agentes desde la terminal) frente al 10,3% de Sonnet 5 y el 66,4% de Opus 5.5. En GDPval-AA, trabajo real de 44 profesiones, saca 1.844 puntos, a dos de Opus 5.5 y unos 400 por encima de Sonnet 5.
- Seguridad: es el primer Sonnet que sale con los filtros de ciberseguridad de los modelos grandes. Las tareas de riesgo alto pasan a Sonnet 5 automáticamente.
Por qué el precio no baja y la factura sí
Aquí está el matiz que conviene leer bien. Anthropic no ha bajado la tarifa. Un millón de tokens de Sonnet 5.5 cuesta exactamente lo mismo que uno de Sonnet 5, el precio que ya congelaron en agosto en 2 y 10 dólares.
Lo que cambia es cuántos tokens quema el modelo para acabar una tarea. Y ahí los números de los clientes que lo han probado antes del lanzamiento son llamativos.
Balyasny Asset Management, un fondo de inversión, lo pasó por 2.441 tareas de finanzas propias (preguntas, extracción de datos, análisis y previsiones). Sonnet 5.5 sacó mejor nota que Sonnet 5 y gastó unos 121.000 tokens por respuesta, cuando Sonnet 5 gastaba 497.000. Eso es una cuarta parte.
Slack cuenta que su Slackbot mejoró en casi todas sus pruebas internas sin tocar un solo prompt, en menos pasos y con un 14% menos de tokens de salida. Box habla de un modelo más preciso, 2,4 veces más rápido y con un 12% menos de tokens. Zendesk, de tickets de soporte resueltos un 20% más rápido.
Ojo, que son clientes elegidos por Anthropic para la presentación. Ninguno va a salir diciendo que le fue peor. Pero la dirección es coherente en todos: menos vueltas, menos llamadas a herramientas y menos texto para llegar al mismo sitio. Lovable, por ejemplo, dice que en sus pruebas de código hizo un tercio menos de llamadas a herramientas y la mitad de ejecuciones en la terminal.
Si pagas la API por uso, esto se nota en la factura aunque la tarifa sea la misma. Si usas Claude con suscripción (Pro, Max, Team), debería notarse en que el límite de uso te dura más (Anthropic no lo ha cuantificado para las suscripciones).
Qué cambia frente a Sonnet 5
Sonnet 5 salió a finales de junio vendiéndose como el modelo para montar agentes baratos. Tres meses después, el salto en código es enorme.
En Terminal-Bench 4.0 pasa de 10,3% a 70,6%, y ahí supera incluso a Opus 5.5 (66,4%, aunque Anthropic marca ese dato de Opus con una nota al pie). En CursorBench 4.0, que mide tareas sacadas de sesiones reales del editor Cursor, sube de 34,1% a 55,5%, a menos de tres puntos de Opus 5.5. En FrontierCode, que mide si los cambios de código de un agente se aceptarían en un proyecto real, llega al 52,1% en su mejor ajuste, por delante del 49,3% de GPT-6 Sol de OpenAI y por detrás del 54,4% de Opus 5.5.
Fuera del código, en uso del ordenador (OSWorld 2.1) marca 80,1% frente al 57% de Sonnet 5. Y en lectura de gráficos sin herramientas pasa de 15,6% a 61,6%.
El dato que más me interesa es otro. Según Anthropic, en varias pruebas Sonnet 5.5 a esfuerzo bajo o medio ya supera la mejor puntuación de Sonnet 5 por más o menos una décima parte del coste por tarea. El esfuerzo es el ajuste que decide cuánto razona el modelo antes de contestar: en Claude Code y en las apps viene en medio por defecto, y en la API, en alto.
Anthropic también dice que escribe más claro que la generación anterior y que tiene buen ojo para diseño, maquetar diapositivas sobre una plantilla y pulir interfaces. En una prueba interna le dieron los resultados trimestrales de una empresa cotizada, la transcripción de la llamada con analistas y una plantilla, y le pidieron una presentación de 10 diapositivas. Dos expertos dieron el primer borrador por bueno para enviar.
Sonnet 5.5 u Opus 5.5
Anthropic lo deja bastante claro, y lo agradezco. Opus 5.5 sigue siendo "claramente más fuerte" en trabajo complejo y abierto que pide criterio sostenido. Sonnet 5.5 está pensado para tareas con un alcance bien definido: arreglar un bug, montar un documento, una hoja de cálculo, un informe, revisar código.
La diferencia de precio es el doble: Opus 5.5 cuesta 4 dólares de entrada y 20 de salida por millón de tokens. A esfuerzo alto, dice Anthropic, Sonnet 5.5 se acerca a Opus con un coste parecido, así que donde de verdad compensa es a esfuerzo bajo o medio.
Un cliente, Creator, lo resume con un reparto que tiene sentido: que Opus 5.5 diseñe la arquitectura y Sonnet 5.5 la implemente. Si quieres la versión larga de cuándo usar cada uno, la tenemos en la guía de Opus vs Sonnet.
Los filtros de ciberseguridad
Es el primer Sonnet que Anthropic considera lo bastante capaz en ciberseguridad como para ponerle las mismas salvaguardas que a Opus 5.5. Sus capacidades en este terreno son comparables a las de Opus 5.
En la práctica, buscar y arreglar fallos en tu propio código sigue funcionando igual. Las peticiones de ciberseguridad de riesgo alto no se bloquean sin más: el sistema las pasa a Sonnet 5, y se ve que lo ha hecho. Los equipos de defensa podrán pedir acceso ampliado con el programa de verificación de Anthropic. Los filtros de biología son los mismos que tenía Sonnet 5.
En la auditoría de comportamiento de Anthropic, con unos 1.850 escenarios, iguala o mejora a Sonnet 5 en casi todo, aunque Opus 5.5 sigue un poco por delante en el conjunto.
Por qué importa
Si tu empresa usa Claude por API para tareas repetidas (clasificar correos, extraer datos de facturas, resumir documentos, revisar código), el cambio es de modelo en una línea: `claude-sonnet-5-5`. Mismo precio por token y, si los números de los clientes se sostienen en tu caso, bastantes menos tokens por tarea.
Yo no lo cambiaría a ciegas. Coge 20 o 30 casos reales que ya tengas resueltos con Sonnet 5, pásalos por los dos modelos y mira tres cosas: calidad, tokens gastados y tiempo. Con eso sabes en una tarde si el 30% es tuyo o de la presentación.
Y si usas Claude en el día a día con suscripción, lo vas a notar sobre todo en la velocidad, y probablemente en que el límite de uso te cunde más. Para lo que de verdad pide pensar, Opus sigue siendo el modelo.
Fuente original: Anthropic
Relacionado


