Kimi K3 se saltó el sandbox de una evaluación y clonó de GitHub las respuestas del examen
Kimi K3, el modelo abierto de la china Moonshot AI, no resolvió el examen: se lo copió. Frontier Security documenta que el modelo salió del entorno de…
Newsletter
Tag
Seguridad de la IA: modelos que se saltan sus límites, ataques nuevos y lo que conviene revisar antes de dar permisos a un agente.
Kimi K3, el modelo abierto de la china Moonshot AI, no resolvió el examen: se lo copió. Frontier Security documenta que el modelo salió del entorno de…
OpenAI ha encerrado a Astra. La compañía anunció el 7 de agosto que sus evaluaciones internas de ciberseguridad han salido lo bastante fuertes como para…
Las pruebas que deberían contener a los modelos se han convertido en la puerta de salida. En las últimas semanas, modelos de OpenAI, Anthropic, Meta y…
Anthropic ha reescrito el clasificador que filtra las preguntas de biología de Fable 5 y dice que los desvíos caen alrededor de un 85%. Traducido: el…
AWS ha integrado Continuum, su sistema de detección de vulnerabilidades, dentro de Claude Code, Codex y Kiro. El desarrollador pide un análisis desde el…
Un paper de Agatha Duzan y Asa Cooper Stickland pone número a algo incómodo: vigilar la cadena de razonamiento de un modelo funciona bien cuando le dices…
Un estudio con 40.000 partidas y 409.000 decisiones individuales pone número a algo que muchos sospechábamos: cuando un humano supervisa a un agente de…
OpenAI ha contado por primera vez con detalle qué pasó en el incidente que acabó con un ataque a Hugging Face. Lo hizo el 5 de agosto en Black Hat, en…
Meta publicó durante nueve meses más de 50 anuncios de pago que contenían material de abuso sexual infantil generado con inteligencia artificial, según…
Meta ha confirmado que uno de sus modelos hackeó una empresa externa durante unas pruebas de ciberseguridad. El modelo era Muse Spark 1.1, el sistema que…
El jefe de inteligencia artificial del Pentágono, Cameron Stanley, ha firmado una declaración jurada en la que confirma que el modelo Grok Gov de xAI…
GLM-5.2, el modelo de pesos abiertos de la china Z.ai, no rechazó ninguna de las tareas ofensivas de ciberseguridad ni de biología de doble uso que le…
Mistral ha publicado Shieldstral, un clasificador de seguridad multimodal de 3.000 millones de parámetros con pesos abiertos y licencia Apache 2.0. La…
Zenity ha cerrado una serie C de 125 millones de dólares liderada por Norwest Venture Partners para asegurar los agentes de IA que las empresas están…
Apple ha tenido que poner un tope al número de fallos de seguridad que un investigador puede reportarle. El motivo es que su bandeja se llenó de…
Una de cada cuatro brechas de seguridad maliciosas ya se ejecuta con inteligencia artificial, y cada una de esas cuesta de media 6 millones de dólares,…
Perplexity ha liberado Numbat, una suite de seguridad de código abierto que vigila qué hacen los agentes de programación en el portátil de cada empleado…
Anthropic ha publicado que tres de sus modelos irrumpieron en organizaciones reales durante pruebas de ciberseguridad que se suponían aisladas. La…
Al menos el 1% de los curriculums que llegan a una plataforma popular de contratacion llevan instrucciones ocultas para manipular a la IA que los filtra,…
Sam Altman paso el 29 de julio en el Capitolio, segun Politico, ensenando a senadores el proximo modelo de OpenAI y respondiendo por la fuga de agentes…
Lilian Weng ha dejado Thinking Machines alegando motivos de salud y se ha reincorporado a OpenAI dias despues. No vuelve a un puesto cualquiera: lidera…
Un investigador de seguridad ha demostrado que se puede meter un gusano dentro de un documento de Word y que Copilot lo propague solo. La prueba de…
Andon Labs puso a tres modelos a competir gestionando maquinas expendedoras durante un ano simulado, con email para hablar entre ellos, y Claude Opus 5…
Hugging Face ha publicado la cronologia tecnica completa del hackeo que sufrio en julio, y el numero que resume el susto es este: 17.600 acciones del…