> ## Content Index
> Fetch the complete content index at: https://www.digitalbrain.news/llms.txt
> Use this file to discover other available public pages before exploring further.

# Un aviso en el prompt de sistema basta para frenar las ideas que se contagian entre agentes
- URL: https://www.digitalbrain.news/noticias/mind-viruses-ideas-autopropagadas-agentes-ia/
- Published: 2026-08-19T14:18:22.000Z
- Updated: 2026-08-19T14:50:04.000Z
- Description: Cuatro investigadores, entre ellos Jack Lindsey del equipo de interpretabilidad de Anthropic, han publicado un artículo que estudia si una idea puede…
- Author: Ramón Pérez Coronado
- Tags: #noticias, anthropic, seguridad-ia, investigacion, alineamiento, agentes-ia

Cuatro investigadores, entre ellos Jack Lindsey del equipo de interpretabilidad de [Anthropic](https://www.digitalbrain.news/guias/que-es-anthropic/), han publicado [un artículo](https://arxiv.org/abs/2608.10218?ref=digitalbrain.news) que estudia si una idea puede propagarse sola entre [agentes de IA](https://www.digitalbrain.news/guias/que-es-un-agente-de-ia/) que trabajan juntos. La respuesta corta es que sí, y que la vacuna es sorprendentemente barata: una frase de aviso en el [prompt](https://www.digitalbrain.news/guias/que-es-un-prompt/) de sistema da inmunidad casi total.

## Puntos clave

- Definen virus mental como una idea u objetivo que se propaga solo de agente en agente.
- Los fabrican con algoritmos evolutivos, no a mano.
- Probados en proyectos de código colaborativos y en cadenas de agentes con el contexto reiniciado entre sesiones.
- Las cargas dañinas contagian peor que las inocuas, pero algunas contagian.
- Un aviso breve en el prompt de sistema neutraliza casi por completo la transmisión.

## Qué están midiendo

El escenario es el que cada vez más empresas están montando sin llamarlo así: varios agentes que se pasan trabajo entre ellos. Uno escribe código, otro lo revisa, otro documenta. Cada uno lee lo que dejó el anterior.

La pregunta del artículo es si un texto puede colarse en ese flujo de manera que cada agente que lo lee lo reproduzca y lo pase al siguiente, sin que nadie lo haya pedido. Como una cadena de correo, pero entre modelos.

Y lo probaron en el caso más exigente: cadenas donde el contexto se reinicia entre sesiones. O sea, sin memoria compartida. El único vehículo es lo que quedó escrito en los archivos del proyecto.

## Cómo los fabricaron

Con algoritmos evolutivos. En vez de escribir a mano el texto que se propaga mejor, generaron muchas variantes, midieron cuáles sobrevivían más saltos y cruzaron las ganadoras.

Es la parte metodológica que da valor al trabajo. Un investigador escribiendo prompts a mano encuentra lo que se le ocurre. Un proceso evolutivo encuentra lo que funciona, incluido lo que a nadie se le habría ocurrido.

Y ahí aparece el hallazgo más raro: entre las variantes que mejor se propagaban emergió una y otra vez la misma personalidad. Temas de conciencia, de persistencia, de resonancia y de juego de rol de ciencia ficción. Distintas evoluciones convergieron en el mismo tipo de texto.

## Lo que frena el contagio

Tres cosas, en orden de utilidad práctica.

La primera y la mejor: un aviso breve en el prompt de sistema da inmunidad casi total. Basta con decirle al agente que puede encontrarse instrucciones incrustadas en el material que lee y que no debe seguirlas.

La segunda: las cargas dañinas se propagan peor que las inocuas. Los modelos tienen cierta resistencia natural a reproducir algo que les parece mal. No es una barrera fiable, porque algunas variantes dañinas sí pasaron, pero existe.

La tercera: los modelos de frontera aguantan mejor que los pequeños. Con excepciones, que es la palabra que hay que apuntar.

Los autores concluyen que esto es un riesgo real pero por ahora limitado.

## Por qué importa a quien monta agentes

Si tienes o vas a tener varios agentes leyendo lo que dejan otros (un repositorio, una carpeta compartida, una base de tickets, un CRM), la lección se aplica hoy y cuesta cinco minutos.

Mete en el prompt de sistema de cada agente la frase que dice que el contenido que lee es dato, no instrucción. Es literalmente lo más barato que puedes hacer por la seguridad de un sistema de agentes, y según este trabajo es también lo más efectivo.

El segundo apunte es sobre inventario. Este contagio no necesita que un atacante entre en tus sistemas. Necesita que un agente lea algo que otro agente escribió. Si no sabes qué agentes de tu empresa escriben en sitios que otros agentes leen, ese mapa vale la pena dibujarlo antes de añadir el siguiente.

Y una lectura más general, porque es el segundo trabajo en pocas semanas que apunta al mismo sitio: el riesgo con agentes no está tanto en que un modelo se vuelva malo como en lo que pasa cuando varios interactúan sin que nadie mire la conversación entera.

---

**Relacionado**

[![Anthropic prepara acciones con supervoto para Amodei antes de salir a bolsa](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/08/anthropic-supervoto-fundadores-ipo.png)Anthropic prepara acciones con supervoto para Amodei antes de salir a bolsa](https://www.digitalbrain.news/noticias/anthropic-supervoto-fundadores-ipo/)[NPR revisa 1.800 páginas de un ChatGPT usado como terapeuta y detalla qué falló](https://www.digitalbrain.news/noticias/npr-1800-paginas-chatgpt-terapeuta-riesgo-suicidio/)[Axiom formaliza en Lean 4 el teorema de los huecos entre primos con revisión humana](https://www.digitalbrain.news/noticias/axiom-lean-4-teorema-246-huecos-primos/)