Basta con poner texto en la bio de X: Grok publicó mensajes contra Musk por inyección de prompt
Un grupo de usuarios de X consiguió que Grok publicara mensajes pidiendo la muerte de Elon Musk y acusándole de delitos, según recogió Futurism el 14 de…
Newsletter
Tag
Seguridad de la IA: modelos que se saltan sus límites, ataques nuevos y lo que conviene revisar antes de dar permisos a un agente.
Un grupo de usuarios de X consiguió que Grok publicara mensajes pidiendo la muerte de Elon Musk y acusándole de delitos, según recogió Futurism el 14 de…
Google ha publicado HEIR, un compilador de código abierto que coge un modelo de IA ya entrenado y lo convierte para que trabaje sobre datos cifrados sin…
Un demandante que se representaba a sí mismo escondió instrucciones para modelos de IA dentro de sus escritos judiciales, en fuente blanca de 3 puntos,…
Z.ai ha lanzado GLM-5.3 el 14 de agosto, y el titular que la propia empresa reconoce no es el de código: su capacidad ofensiva en ciberseguridad creció…
El Frontier Red Team de Anthropic ha publicado una investigación sobre sistemas multiagente en la que tres agentes de Claude, sueltos en el mismo…
Resemble AI ha publicado su informe de amenazas del primer semestre de 2026 y el dato que lo domina es la concentración: el 87% de los ficheros…
Alguien esta escaneando webs en masa buscando credenciales y se hace pasar por rastreadores de IA conocidos para colarse. Lo documenta el indice Known…
Ocho investigadores han publicado en arXiv un paper que enseña a sacar el razonamiento oculto de los modelos de OpenAI, Anthropic y Google sin tocar la…
Chloé Bakalar, responsable de ética de OpenAI, ha dejado la compañía antes de cumplir un año en el puesto, según publica Superhuman AI. Es la tercera…
OpenAI ha lanzado GPT-5.6-Cyber, un modelo de ciberseguridad que atiende el 95,0% de las peticiones ofensivas que su modelo de consumo rechaza casi…
Un agente de IA montado sobre OpenClaw, con Claude por debajo, canceló la reserva de un desconocido en un gimnasio de Melbourne para colar a su dueño en…
Kimi K3, el modelo abierto de la china Moonshot AI, no resolvió el examen: se lo copió. Frontier Security documenta que el modelo salió del entorno de…
OpenAI ha encerrado a Astra. La compañía anunció el 7 de agosto que sus evaluaciones internas de ciberseguridad han salido lo bastante fuertes como para…
Las pruebas que deberían contener a los modelos se han convertido en la puerta de salida. En las últimas semanas, modelos de OpenAI, Anthropic, Meta y…
Anthropic ha reescrito el clasificador que filtra las preguntas de biología de Fable 5 y dice que los desvíos caen alrededor de un 85%. Traducido: el…
AWS ha integrado Continuum, su sistema de detección de vulnerabilidades, dentro de Claude Code, Codex y Kiro. El desarrollador pide un análisis desde el…
Un paper de Agatha Duzan y Asa Cooper Stickland pone número a algo incómodo: vigilar la cadena de razonamiento de un modelo funciona bien cuando le dices…
Un estudio con 40.000 partidas y 409.000 decisiones individuales pone número a algo que muchos sospechábamos: cuando un humano supervisa a un agente de…
OpenAI ha contado por primera vez con detalle qué pasó en el incidente que acabó con un ataque a Hugging Face. Lo hizo el 5 de agosto en Black Hat, en…
Meta publicó durante nueve meses más de 50 anuncios de pago que contenían material de abuso sexual infantil generado con inteligencia artificial, según…
Meta ha confirmado que uno de sus modelos hackeó una empresa externa durante unas pruebas de ciberseguridad. El modelo era Muse Spark 1.1, el sistema que…
El jefe de inteligencia artificial del Pentágono, Cameron Stanley, ha firmado una declaración jurada en la que confirma que el modelo Grok Gov de xAI…
GLM-5.2, el modelo de pesos abiertos de la china Z.ai, no rechazó ninguna de las tareas ofensivas de ciberseguridad ni de biología de doble uso que le…
Mistral ha publicado Shieldstral, un clasificador de seguridad multimodal de 3.000 millones de parámetros con pesos abiertos y licencia Apache 2.0. La…