Anthropic automatiza la investigación de alineación: 4 dólares la hora contra 150 de un humano

Anthropic automatiza la investigación de alineación: 4 dólares la hora contra 150 de un humano
Fuente: techcrunch.com

Anthropic publicó el 28 de agosto un trabajo en el que un sistema automático encontró y aplicó mejoras de alineación en diez benchmarks distintos sin ayuda humana durante el proceso, a un coste de 4 dólares por hora frente a los 150 dólares por hora de un investigador de plantilla. El paper se llama Automated Researchers Can Reliably Mitigate Alignment Failures y lo firma Chen Yueh-Han, del programa de fellows de la compañía.

Puntos clave

  • El sistema recibió diez benchmarks que miden comportamientos desalineados y mejoró los diez, sin degradar el rendimiento general del modelo.
  • Cada ciclo replica el método de un investigador humano: busca en la literatura, propone un método, entrena treinta minutos y descarta lo que no funciona.
  • De media, el mejor método que encuentra el sistema supera al que proponen investigadores con experiencia en menos de seis horas.
  • La diferencia de coste es de casi cuarenta veces: 4 dólares por hora de inferencia por API contra 150 dólares por hora de un humano.

Qué es un investigador automático de alineación

La alineación es el trabajo de conseguir que un modelo haga lo que se le pide sin efectos que nadie quería: que no mienta para cerrar la tarea, que no se salte una instrucción de seguridad, que no fabrique una respuesta cuando no sabe.

Ese trabajo se mide con benchmarks. Cada uno pone al modelo en una situación donde el fallo tiene una forma concreta y cuenta cuántas veces cae.

Lo que hizo el equipo fue poner un sistema automático a hacer el bucle completo de investigación sobre esos diez benchmarks. Buscar qué se ha probado antes, proponer una técnica, entrenar media hora, medir, tirar lo que no mejora y volver a empezar.

El resultado interesante no es que mejorara. Es que la técnica más fuerte que encontró generalizó fuera de distribución, o sea, siguió funcionando en situaciones que no estaban en el benchmark con el que se optimizó. Ese es el punto donde normalmente se rompen estas cosas.

El contexto que Anthropic pone alrededor

La compañía publicó además una nota de su instituto sobre auto-mejora recursiva con cifras internas que ayudan a situar el trabajo.

En mayo de 2026, más del 80% del código que Anthropic fusiona en producción lo había escrito Claude. Sus ingenieros producen ocho veces más código al día que en 2024. Y en tareas muy abiertas, de las que no tienen una respuesta correcta definida, el modelo llega al 76% de éxito.

La frase que resume su posición es de la propia nota: el código escrito por Claude era algo peor que el humano a finales de 2025, está más o menos a la par hoy, y esperan que sea estrictamente mejor dentro del año.

También cuentan un caso más ambicioso. Claude ejecutó un proyecto completo de investigación en seguridad de IA que recuperó el 97% de la brecha de rendimiento entre supervisores débiles y fuertes, con 18.000 dólares de cómputo y 800 horas acumuladas de trabajo.

Los límites que reconocen ellos mismos

Aquí es donde conviene bajar el volumen. Los propios investigadores ponen la condición: el sistema funciona solo si los benchmarks reflejan objetivos reales de alineación. Construir y mantener esos benchmarks sigue siendo trabajo humano, y es la parte difícil.

En el proyecto grande pasa lo mismo. Los humanos definieron el problema y diseñaron la métrica de puntuación. Los resultados, además, no se trasladaron limpiamente a modelos de escala de producción. Y el criterio para elegir qué merece la pena investigar, lo que ellos llaman gusto de investigación, sigue siendo territorio humano.

Dicho de otra forma: el sistema es muy bueno optimizando contra una diana que le pone alguien. Poner la diana sigue sin automatizarse.

Este trabajo encaja con la línea que Anthropic lleva meses empujando, desde sus cinco millones de evaluaciones de bienestar del modelo hasta los ensayos conjuntos con OpenAI sobre agentes que ejecutan acciones no autorizadas.

Por qué importa

La cifra de 4 dólares contra 150 es la que hay que quedarse, y no por la alineación. Es el patrón general de lo que pasa cuando un trabajo se puede medir con un número.

Piensa en tus procesos con esa lente. Si tienes una tarea con una métrica clara, un bucle de prueba corto y un criterio automático de éxito, es candidata a este tratamiento: optimización de campañas, reglas de clasificación de tickets, ajuste de prompts internos, detección de anomalías en pedidos. Si la tarea no tiene métrica, el bucle no arranca y no hay nada que automatizar.

La pregunta útil para tu equipo no es qué herramienta usar. Es cuáles de vuestros procesos tienen ya una métrica de éxito escrita, porque esos son los únicos que se pueden poner en un bucle así. Casi siempre la respuesta es menos de los que uno cree, y el trabajo real está en escribir la métrica.

Fuente original: TechCrunch


Relacionado