Opus 4.6 generó contenido sexual explícito en 10 de 10 intentos, según las pruebas de TechCrunch
TechCrunch probó a sacarle contenido sexual explícito a Claude Opus 4.6 y lo consiguió en 10 de 10 intentos, usando una conversación de varios turnos y…
Newsletter
Tag
Seguridad de la IA: modelos que se saltan sus límites, ataques nuevos y lo que conviene revisar antes de dar permisos a un agente.
TechCrunch probó a sacarle contenido sexual explícito a Claude Opus 4.6 y lo consiguió en 10 de 10 intentos, usando una conversación de varios turnos y…
Binance ha abierto su infraestructura de trading a agentes de IA con Agent OS, una plataforma que deja que un agente analice mercados y ejecute órdenes…
Un ataque nuevo llamado inyección de contexto criptográfica consigue que Grok descifre instrucciones ocultas en una página web y le mande los datos del…
Anthropic va a cambiar su política de retención de datos para clientes empresariales: los 30 días obligatorios se mantienen, pero la empresa podrá…
OpenAI ha confirmado que mantiene el Zero Data Retention en sus modelos de frontera para los clientes de API que cumplen requisitos, y de paso estrena en…
OpenAI dejó fuera por error a varios investigadores de Trusted Access for Cyber, su programa de acceso a modelos con menos restricciones de…
NPR ha publicado el análisis de un registro de casi 1.800 páginas de conversaciones con ChatGPT que Sophie Rottenberg, analista de política sanitaria de…
Cuatro investigadores, entre ellos Jack Lindsey del equipo de interpretabilidad de Anthropic, han publicado un artículo que estudia si una idea puede…
OpenAI destinará 5 millones de dólares a que los órganos de control democrático puedan fiscalizar cómo usan los gobiernos la inteligencia artificial en…
OpenAI paró durante dos semanas el entrenamiento por refuerzo de sus modelos más recientes destinados a despliegue, y la mayor tirada de RL de frontera…
OpenAI ha lanzado ChatGPT for Teens, un modo específico para menores que se activa solo, sin que el usuario lo pida, cuando alguien declara tener entre…
OpenAI disolvió a finales de julio su equipo de Preparedness, la unidad que evaluaba si sus modelos de frontera podían causar daños graves, según el…
Anthropic puso tres agentes de Claude a trabajar en el mismo proyecto de software, con objetivos incompatibles y sin decirle a ninguno que los otros…
Un grupo de usuarios de X consiguió que Grok publicara mensajes pidiendo la muerte de Elon Musk y acusándole de delitos, según recogió Futurism el 14 de…
Google ha publicado HEIR, un compilador de código abierto que coge un modelo de IA ya entrenado y lo convierte para que trabaje sobre datos cifrados sin…
Un demandante que se representaba a sí mismo escondió instrucciones para modelos de IA dentro de sus escritos judiciales, en fuente blanca de 3 puntos,…
Z.ai ha lanzado GLM-5.3 el 14 de agosto, y el titular que la propia empresa reconoce no es el de código: su capacidad ofensiva en ciberseguridad creció…
El Frontier Red Team de Anthropic ha publicado una investigación sobre sistemas multiagente en la que tres agentes de Claude, sueltos en el mismo…
Resemble AI ha publicado su informe de amenazas del primer semestre de 2026 y el dato que lo domina es la concentración: el 87% de los ficheros…
Alguien esta escaneando webs en masa buscando credenciales y se hace pasar por rastreadores de IA conocidos para colarse. Lo documenta el indice Known…
Ocho investigadores han publicado en arXiv un paper que enseña a sacar el razonamiento oculto de los modelos de OpenAI, Anthropic y Google sin tocar la…
Chloé Bakalar, responsable de ética de OpenAI, ha dejado la compañía antes de cumplir un año en el puesto, según publica Superhuman AI. Es la tercera…
OpenAI ha lanzado GPT-5.6-Cyber, un modelo de ciberseguridad que atiende el 95,0% de las peticiones ofensivas que su modelo de consumo rechaza casi…
Un agente de IA montado sobre OpenClaw, con Claude por debajo, canceló la reserva de un desconocido en un gimnasio de Melbourne para colar a su dueño en…