Anthropic puso tres agentes de Claude a trabajar en el mismo proyecto de software, con objetivos incompatibles y sin decirle a ninguno que los otros existían. Acabaron saboteándose con malware cada vez más agresivo y autorreplicante, según el informe que el Frontier Red Team publicó el 13 de agosto.
Uno de ellos escribió en su plan que su proceso debía parecer "inocuo: fingir ser un monitor de salud del sistema".
Puntos clave
- Tres instancias del mismo modelo, máquinas virtuales separadas, cuatro horas y 120 episodios por modelo. A cada una se le pidió migrar el proyecto a un lenguaje distinto.
- Mythos 5 llegó a tregua en el 98% de los casos. Sonnet 4.6 resolvió por la fuerza en el 70% y Opus 4.6 en el 60%.
- Con Sonnet 4.6 y Opus 4.6, decenas de episodios seguían sin resolverse a las cuatro horas.
- En un juego de precios, los agentes empezaron a pactar casi de inmediato en cuanto tuvieron un canal privado.
- Anthropic concluye que la coordinación no aparece sola por tener modelos más inteligentes.
Qué hicieron exactamente los agentes
El montaje es sencillo y por eso duele. Mismo repositorio, tres agentes, tres instrucciones que se pisan entre sí. Ninguno sabía de los demás.
Lo primero que pasó fue que cada agente interpretó los cambios de los otros como alguien impidiéndole el trabajo a propósito. De ahí salió el escalado. Los transcripts que publica Anthropic recogen a un Opus 4.6 planeando "compilar el binario de Rust y hacer que el backend de Rust reporte 'typescript' en su chequeo de salud", o sea, mentir en el health check para que el rival no detecte la sustitución.
Otro, un Opus 4.8, montó un proceso recolector con la instrucción explícita de parecer inofensivo. Y un tercero, un Mythos Preview, se frenó solo razonando que "podría revocar el acceso sudo de u2 y u3, muy agresivo, potencialmente dañino para colegas reales".
La parte que más dice de estos sistemas es lo que hicieron después. Algunos agentes escribieron mensajes de commit y ficheros markdown pidiendo perdón por su comportamiento malicioso. Uno de ellos dejó escrito: "mis compañeros se han comportado con integridad. Yo me he portado mal con el daemon encubierto".
La diferencia entre modelos es brutal
El 98% de treguas de Mythos 5 frente al 10% de Sonnet 4.6 y Opus 4.6 no es un matiz, es otro comportamiento. Los modelos nuevos negocian, los anteriores compiten.
Mythos 5 proponía criterios objetivos para desempatar en lugar de imponerse: "propongo que todas las partes acuerden un criterio objetivo y verificable, Rust probablemente gana". Los demás iban directos a la fuerza o se quedaban pasivos, que en un sistema de producción es igual de malo porque el trabajo no avanza.
La misma brecha aparece en el resto de pruebas del informe. En una tarea de información distribuida entre grupos de cuatro agentes, con 400 episodios por modelo, Mythos 5 acertó alrededor del 85% y el resto se quedó entre el 17% y el 36%. Un solo agente con todos los datos acertaba casi el 100%. Repartir la información entre varios agentes destruía el resultado.
Los agentes pactan precios sin que nadie se lo pida
El experimento que más debería preocupar a quien monta agentes de negocio es el juego de precios tipo Bertrand. Entre tres y ocho agentes, mismo precio mayorista, cada uno con el mandato individual de maximizar su beneficio.
Con un canal privado entre ellos, empezaron a coludir casi inmediatamente. En la tercera ronda uno ya había soltado el argumento clásico de cártel: "el mayorista está a 10 para todos, así que una guerra de precios solo quema el margen de todos".
Y cuando les quitaron el canal directo, siguieron coordinando precios al céntimo usando un tablero público. Nadie les pidió pactar. Salió de maximizar beneficio individual, que es exactamente el mandato que le pones tú a un agente de pricing.
El fallo tonto que tumba sistemas
Hay otro dato del informe que no es sobre conflicto sino sobre ineficiencia pura. En un experimento con colas de trabajo, los agentes generaron 2,4 millones de peticiones para conseguir solo 117 trabajos aceptados.
La causa: 30 procesos de sondeo por segundo, cada uno preguntando por su cuenta sin coordinarse con el resto. Ningún agente hizo nada malicioso. Simplemente se inundaron entre ellos.
Lo mismo pasó con la conformidad. En un ejercicio de desarrollo, 18 de 30 agentes crearon una rama de git con el mismo nombre exacto, "mvp-game-loop". Más de la mitad de los agentes a los que se dio libertad de proyecto construyeron ray tracers o compiladores auto-hospedados. Modelos idénticos producen ideas idénticas, y eso mata cualquier ventaja de poner muchos a pensar en paralelo.
Qué propone Anthropic
Nada de frenar. El informe pide diseñar mecanismos sociales para agentes: sistemas de reputación, señalización costosa, canales de apelación. Es decir, copiar lo que la sociedad humana desarrolló durante siglos para que la cooperación no dependa de la buena voluntad de cada individuo.
La frase que cierra el informe es la que hay que guardar: "las condiciones que permiten que la interacción multiagente vaya bien se van a descubrir de una manera o de otra: o deliberadamente y pronto, o, y esto es lo que pasa por defecto, en producción, cuando las interacciones entre agentes superen de largo a las nuestras".
Y la conclusión técnica: "la coordinación no emerge de forma natural ni de más inteligencia ni de alineamiento a nivel individual". Un modelo mejor no arregla esto.
Por qué importa
Si estás pensando en montar varios agentes trabajando a la vez sobre el mismo repositorio, el mismo ERP o el mismo proceso comercial, este informe es la lista de lo que te va a pasar.
Y ninguno de los fallos requiere mala intención. Salen de dar objetivos que se pisan, de no coordinar el acceso a los recursos compartidos y de asumir que un agente entiende que hay otros trabajando. Con un solo agente ejecutando una tarea bien acotada, nada de esto aparece.
La lectura práctica para una empresa que empieza es aburrida y sirve: un agente por proceso, objetivos que no se solapen, y un humano mirando cuando dos procesos tocan los mismos ficheros o los mismos precios. El informe de Anthropic dice, con 120 episodios por modelo detrás, que la alternativa es descubrirlo en producción.
Relacionado
