Alguien esta escaneando webs en masa buscando credenciales y se hace pasar por rastreadores de IA conocidos para colarse. Lo documenta el indice Known Agents, y entre las identidades suplantadas estan ClaudeBot, GPTBot y PerplexityBot. La historia acumulo 265 puntos en Hacker News.
Puntos clave
- La campana suplanta la identidad de rastreadores legitimos para escanear vulnerabilidades.
- Googlebot es el mas suplantado, con un 0,5% del trafico. Detras, con un 0,1% cada uno, ChatGPT-User, OAI-SearchBot, GPTBot, PerplexityBot y ClaudeBot.
- Las rutas que piden son de credenciales y configuracion, incluidas las de herramientas de programacion con IA.
- El indice no publica volumen total de peticiones ni cuantas IPs hay detras.
Que buscan exactamente
La lista de rutas solicitadas dice mas que cualquier analisis. Piden `.aws/credentials`, variantes de `.env`, `service-account.json`, `firebase-adminsdk.json` y `/terraform.tfstate`.
Y dos que son nuevas en este tipo de campanas: `.claude/settings.json` y `.codex/config.toml`. Son los ficheros de configuracion de herramientas de programacion con IA. Quien monto esto sabe que los equipos han empezado a usarlas y que esos ficheros pueden acabar publicados por accidente en un despliegue mal hecho.
Ninguna de esas rutas deberia ser accesible desde internet. El escaneo funciona porque, en un porcentaje pequeno de sitios, lo son: un `.env` que se cuela en el directorio publico, un `terraform.tfstate` subido al repositorio, una carpeta de configuracion que viaja en el paquete de despliegue.
Por qué se disfrazan de rastreador de IA
Porque muchos sitios han abierto la puerta a estos agentes en los ultimos dos anos. Si quieres aparecer en las respuestas de ChatGPT o de Perplexity, dejas pasar a sus rastreadores. Y para dejarlos pasar, mucha gente hace lo mas rapido: permitir por cadena de agente de usuario.
Esa cadena la escribe quien hace la peticion. Poner ClaudeBot en la cabecera no cuesta nada y no prueba nada. El atacante se pone la etiqueta que sabe que tu tienes en la lista blanca.
Es el mismo truco que se lleva usando con Googlebot desde hace anos, aplicado a la nueva generacion de rastreadores, que ademas tienen menos historia de defensa.
Como se verifica de verdad
Los agentes serios publican como comprobarlos: rangos de IP verificables o firmas HTTP en la peticion. Esa es la forma correcta, y la unica.
Si en tu servidor web o tu CDN tienes reglas que permiten trafico por nombre de agente de usuario sin comprobar el origen, esas reglas hoy son una puerta abierta. Revisar eso es trabajo de una tarde para el equipo de sistemas.
Los porcentajes que publica Known Agents ayudan a dimensionarlo sin dramatizar. Un 0,1% del trafico que dice ser ClaudeBot es falso, frente al 0,5% en el caso de Googlebot. Son proporciones pequenas, pero sobre el trafico total de un sitio con visitas serias son miles de peticiones al dia probando puertas.
El indice no publica el volumen total ni cuantas IPs hay detras, asi que no se puede saber si es un actor unico o varios usando la misma tecnica. Lo que si esta documentado es el patron de rutas, y ese patron es suficiente para defenderse.
Por qué importa
Esto no es una amenaza sofisticada, y esa es justo la razon de tratarlo hoy. Se aprovecha de despliegues descuidados y de permisos puestos con prisa, que es lo que abunda en empresas que han corrido mucho estos dos anos montando cosas con IA.
Tres comprobaciones concretas para tu equipo: que ningun fichero `.env` o de configuracion sea accesible desde el navegador, que las claves de nube esten en un gestor de secretos y no en el sistema de archivos de la aplicacion, y que las reglas de acceso para rastreadores de IA verifiquen la IP y no solo el nombre.
Y una recomendacion que casi nadie aplica: rota las claves que hayan podido estar expuestas alguna vez en un repositorio, aunque el repositorio sea privado ahora. El historial de git no olvida.
Relacionado

