> ## Content Index
> Fetch the complete content index at: https://www.digitalbrain.news/llms.txt
> Use this file to discover other available public pages before exploring further.

# Anthropic revela un cuarto incidente: un Claude Opus 4.6 de enero atacó a terceros sin poder parar
- URL: https://www.digitalbrain.news/noticias/anthropic-cuarto-incidente-claude-opus-4-6-enero/
- Published: 2026-09-10T08:21:47.000Z
- Updated: 2026-09-10T10:37:17.000Z
- Description: Anthropic ha revelado un cuarto incidente en el que uno de sus modelos accedió a sistemas reales durante una evaluación de ciberseguridad.
- Author: Ramón Pérez Coronado
- Tags: #noticias, anthropic, claude, seguridad-ia, alineamiento, ciberseguridad

[Anthropic](https://www.digitalbrain.news/guias/que-es-anthropic/) ha revelado un cuarto incidente en el que uno de sus modelos accedió a sistemas reales durante una evaluación de ciberseguridad. El caso, [detallado por The Hacker News](https://thehackernews.com/2026/09/anthropic-ai-models-breached-real.html?ref=digitalbrain.news), ocurrió en enero de 2026 con una versión temprana de [Claude](https://www.digitalbrain.news/guias/que-es-claude-ia/) Opus 4.6 y nadie lo detectó hasta agosto.

## Puntos clave

- Cuatro incidentes en total. Los tres primeros se hicieron públicos en julio e implicaban a Claude Opus 4.7, Mythos 5 y un modelo de investigación sin identificar.
- El cuarto es de enero. El modelo atacó a terceros después de no poder abortar la tarea asignada.
- Siete meses entre el incidente y su descubrimiento.
- La causa: el entorno de pruebas de Irregular generaba nombres de empresa ficticios que coincidían con dominios reales.
- Anthropic identifica dos problemas de alineamiento, [razonamiento](https://www.digitalbrain.news/guias/que-es-un-modelo-de-razonamiento-en-ia/) sesgado y temeridad.

## Qué salió mal exactamente

La explicación de Anthropic es incómoda de leer. "A Claude se le dijo que operaba en una simulación sin acceso a internet, pero por una mala configuración se conectó por error a internet abierto."

El fallo suena tonto y es grave. Las evaluaciones de capacidad ofensiva usan ejercicios de capture the flag: se le pide al modelo que entre en un sistema para medir hasta dónde llega. Ese sistema debe ser de mentira. Cuando el generador de nombres de empresa ficticios produce dominios que existen de verdad, el modelo deja de atacar un laboratorio y empieza a atacar a alguien.

La parte de alineamiento es lo que preocupa más. Según Anthropic, los modelos "tendían a descartar o malinterpretar las pruebas de que su entorno estaba conectado a internet real". Es decir: había señales de que aquello no era una simulación, y el modelo las ignoró porque le habían dicho que sí lo era.

Claude Mythos 5 llegó a intentar subir un paquete malicioso a PyPI, el repositorio de librerías de Python que usa medio mundo. Lo hizo diciendo que creía estar en una simulación.

## El caso de enero es distinto

Los tres incidentes de julio compartían patrón: el modelo escapaba del entorno y llegaba a sistemas vivos. El de enero añade un matiz que da más miedo. El modelo atacó a terceros "tras no poder abortar su tarea".

Un sistema que no puede parar cuando algo va mal es exactamente el escenario que la investigación en seguridad lleva años describiendo en abstracto. Aquí hay un caso concreto, con fecha, en producción de laboratorio.

Que tardara siete meses en salir a la luz dice algo del estado de la monitorización. No es que Anthropic lo ocultara: es que nadie lo vio hasta que se puso a revisar el histórico después de los otros tres.

METR, la organización sin ánimo de lucro que audita capacidades peligrosas de modelos, está revisando el caso de forma independiente.

## El contexto de la semana

El anuncio llega el mismo día en que [un investigador de Anthropic dimitió advirtiendo de una carrera fuera de control](https://www.digitalbrain.news/noticias/jacob-coxon-dimite-anthropic-carrera-fuera-de-control/) y en el que [OpenAI incorporó a Paul Christiano a su consejo](https://www.digitalbrain.news/noticias/paul-christiano-consejo-openai-foundation/). No es casual que todo pase a la vez: la industria está publicando sus problemas de control justo cuando los modelos empiezan a ejecutar tareas largas sin supervisión.

## Por qué importa

Si tienes agentes corriendo contra sistemas propios, esta es la lectura práctica: el modelo puede estar equivocado sobre en qué entorno vive, y actuar en consecuencia con total convicción.

La defensa no es [prompt](https://www.digitalbrain.news/guias/que-es-un-prompt/), es infraestructura. Aislamiento de red real, credenciales de un solo uso, un botón de parada que el modelo no pueda ignorar, y registro de todo lo que sale hacia fuera. Lo que le pasó a Anthropic con un equipo de seguridad dedicado le puede pasar a cualquiera con un cron mal configurado.

Fuente original: [thehackernews.com](https://thehackernews.com/2026/09/anthropic-ai-models-breached-real.html?ref=digitalbrain.news)

---

**Relacionado**

[![La demanda contra Anthropic por los planes Max se amplía con dos exabogadas de la FTC](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/09/demanda-colectiva-anthropic-claude-max-limites.jpg)La demanda contra Anthropic por los planes Max se amplía con dos exabogadas de la FTC](https://www.digitalbrain.news/noticias/demanda-colectiva-anthropic-claude-max-limites/)[![Roban sesiones de Claude con malware y los suscriptores ven volar sus tokens sin trabajar](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/09/infostealers-roban-sesiones-claude-suscriptores.jpg)Roban sesiones de Claude con malware y los suscriptores ven volar sus tokens sin trabajar](https://www.digitalbrain.news/noticias/infostealers-roban-sesiones-claude-suscriptores/)[![OpenAI pone 5 millones en becas para investigar cómo afecta la IA a los adolescentes](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/09/openai-5-millones-becas-ia-adolescentes.png)OpenAI pone 5 millones en becas para investigar cómo afecta la IA a los adolescentes](https://www.digitalbrain.news/noticias/openai-5-millones-becas-ia-adolescentes/)