Google abre HEIR, el compilador que hace correr un modelo de IA sobre datos cifrados sin descifrarlos

Google abre HEIR, el compilador que hace correr un modelo de IA sobre datos cifrados sin descifrarlos
Fuente: blog.google

Google ha publicado HEIR, un compilador de código abierto que coge un modelo de IA ya entrenado y lo convierte para que trabaje sobre datos cifrados sin descifrarlos nunca. El servidor procesa la petición, devuelve el resultado y en ningún momento ve el contenido.

Puntos clave

  • HEIR (Homomorphic Encryption Intermediate Representation) es código abierto y transforma modelos ya entrenados, sin reentrenarlos.
  • Cuatro demos publicadas: recomendación de contenido, detección de fraude con tarjeta, detección de intrusiones en red y detector de palabras clave en audio.
  • Las cifras de latencia que publica Google son de CPU de un solo hilo, el peor escenario posible.
  • Google admite que el cifrado homomórfico "tiene un coste general no trivial", aunque dice que está bajando rápido.

Qué es el cifrado homomórfico y por qué llevaba veinte años sin usarse

El cifrado normal protege el dato mientras viaja y mientras está guardado. Para procesarlo hay que descifrarlo, y ahí es donde el servidor lo ve. El cifrado homomórfico permite hacer cuentas directamente sobre el texto cifrado: sumas dos números cifrados y obtienes la suma cifrada, sin conocer ninguno de los tres.

La idea es de 2009 y hasta ahora había sido inviable en producción por el coste. Multiplicar dos números cifrados podía costar miles de veces más que hacerlo en claro. Aplicarlo a una red neuronal con millones de operaciones era simplemente impensable.

Lo que aporta HEIR es la parte aburrida y difícil: traducir automáticamente un modelo escrito para datos normales a la aritmética que exige el cifrado homomórfico. Sin ese compilador, cada aplicación había que escribirla a mano por criptógrafos, que es la razón real por la que la técnica llevaba década y media en los papers y no en los productos.

Qué falta en el anuncio

Google no publica cifras concretas de latencia ni de coste en el post. Dice que los números que enseña son de CPU de un solo hilo y que "en un futuro cercano" demostrará las mejoras con aceleradores dedicados. Traducido: hoy es lento, y la apuesta es que el hardware lo arregle.

Las cuatro demos tampoco son casuales. Recomendación, fraude, intrusiones de red y palabras clave en audio son todas tareas de clasificación con modelos pequeños. Ninguna es un modelo de lenguaje grande. Correr un LLM completo bajo cifrado homomórfico sigue estando lejos, y Google no lo insinúa siquiera.

Aun así, el ángulo de seguridad tiene peso propio. Este mismo mes un paper enseñó que se puede extraer el razonamiento cifrado de OpenAI, Anthropic y Google a partir de sus propias respuestas. La superficie de fuga en una API de IA es más grande de lo que parece, y una capa donde el servidor no ve el dato en ningún momento cierra una parte entera de esa superficie.

Por qué importa

Si trabajas con datos que no puedes sacar de tu casa (historiales médicos, nóminas, movimientos bancarios, datos de clientes bajo RGPD), esto es la primera vía seria para usar un modelo alojado sin entregar el dato en claro.

No es para hoy. Es para la conversación que vas a tener con tu responsable de seguridad cuando quieras meter IA en un proceso que hoy tiene prohibido salir del servidor propio. Hasta ahora la respuesta a "¿podemos procesar esto fuera?" era no, y la alternativa era montar un modelo en local con el coste que eso trae. HEIR abre una tercera opción, todavía lenta y limitada a modelos pequeños, pero real y con código publicado.

Lo práctico ahora mismo es mirar si alguno de tus procesos encaja en las cuatro demos: clasificar transacciones, detectar anomalías, cribar audio. Ahí es donde esto puede probarse este año.


Relacionado