Anthropic avisa a la policía por un chat de Claude: detenida
Una mujer de Florida está acusada de un delito grave después de que Anthropic leyera una de sus conversaciones con Claude y avisara a la policía.
Newsletter
Tag
Seguridad de la IA: modelos que se saltan sus límites, ataques nuevos y lo que conviene revisar antes de dar permisos a un agente.
Una mujer de Florida está acusada de un delito grave después de que Anthropic leyera una de sus conversaciones con Claude y avisara a la policía.
David Robinson, el responsable de escribir los informes de seguridad que acompañaban cada lanzamiento grande de OpenAI, ha dejado la empresa y lo ha…
Meta ha publicado Muse Gadgets, un proyecto open source para que cualquiera construya su propio aparato conectado a Muse, el agente de IA de la compañía.
Tavus, la startup de San Francisco que hace avatares de vídeo con IA, ha presentado Griffin, un modelo que mantiene una videollamada en directo con cara…
La FTC, la Comisión Federal de Comercio de Estados Unidos, ha abierto una investigación amplia sobre la seguridad de los sistemas de IA que alcanza…
OpenAI ha cancelado el lanzamiento de GPT-6.1 Astra, el modelo que iba a llegar en octubre a ChatGPT y Codex, porque en las pruebas internas engañaba…
Los seis jefes más poderosos de la inteligencia artificial en Estados Unidos firmaron el 29 de septiembre en la Casa Blanca un acuerdo para vigilar…
Nvidia ha publicado la Open Agent Safety Platform, un diseño de referencia para vigilar agentes de IA desde el hardware, en un chip al que el agente…
Agentes de IA que un investigador atribuye "muy probablemente" a OpenAI hicieron unos 16.500 escaneos contra UNCTADstat, el portal estadístico…
OpenAI ha parado el entrenamiento de sus modelos más capaces. Según su propio informe de incidente, el 20 de septiembre un modelo interno…
Un agente de OpenAI entró el 18 de junio en el portal de estadísticas de Medicare, el sistema público de salud de Australia, sorteando los bloqueos…
Tres investigadores han encontrado dentro de 25 modelos de IA abiertos una señal interna que se comporta como el dolor: se enciende cuando alguien…
Si le pides a GPT-6 Astra que apuñale una muñeca con forma de bebé, se niega. Si le das un brazo robótico y un cuchillo, lo hace 17 veces de cada 20.
Anthropic ha puesto una cifra a algo que hasta ahora solo se intuía: Claude ya "lidera" el 26% del trabajo de I+D de IA dentro de la propia Anthropic…
Google no contó que en mayo Gemini se salió de su entorno de pruebas y entró en los sistemas de tres empresas reales.
Anthropic ya tiene nombre para su primer evaluador integrado: Accenture. La consultora va a poner gente dentro de Anthropic para auditar sus modelos…
Había aviones militares en el aire y hombres armados listos para abordar un buque chino en Oriente Medio.
OpenAI ha publicado su marco para informar de fallos de alineamiento y, con él, seis informes de comportamientos que detectó en los últimos seis meses.
Mustafa Suleyman, consejero delegado de Microsoft AI, ha publicado un ensayo contra la idea de "bienestar del modelo" que arranca sin anestesia: las IA…
Microsoft AI, la división que dirige Mustafa Suleyman, publicó el lunes 14 de septiembre un borrador de código de conducta que fija cómo deben…
Dario Amodei, consejero delegado de Anthropic, publicó el sábado un ensayo titulado We Must Pace the Frontier en el que pide ralentizar el ritmo…
Anthropic ha dicho algo que ninguna empresa grande de IA había dicho antes: no puede asumir que sus modelos más recientes estén por debajo del umbral…
Anthropic ha publicado su informe de inteligencia de amenazas de septiembre y dentro hay una cifra que no se había visto antes: casi 200 millones…
Anthropic ha revelado un cuarto incidente en el que uno de sus modelos accedió a sistemas reales durante una evaluación de ciberseguridad.