DeepMind prueba las primeras evaluaciones a doble ciego de un modelo de IA

DeepMind prueba las primeras evaluaciones a doble ciego de un modelo de IA
Ilustración: Digital Brain

Google DeepMind ha lanzado el primer piloto de evaluación a doble ciego de un modelo de IA propietario. Los evaluadores externos no ven los pesos del modelo y Google no ve las preguntas del test, y lo que garantiza las dos cosas es criptografía, no un contrato de confidencialidad.

Puntos clave

  • Participan Google DeepMind, el Singapore AI Safety Institute, OpenMined, AVERI y MLCommons.
  • El modelo evaluado en el piloto es un Gemini Flash Lite, contra benchmarks confidenciales.
  • El mecanismo son espacios criptográficos seguros que impiden a cada parte ver lo del otro lado.
  • Objetivo declarado: acabar con la contaminación de benchmarks, que "puede inflar artificialmente las puntuaciones y socavar la confianza".

El problema que hay debajo

Los benchmarks de IA llevan años con una grieta que todo el mundo conoce y casi nadie puede medir: si las preguntas del test están en internet, hay una probabilidad alta de que el modelo las haya visto durante el entrenamiento. Y un examen cuyas respuestas están en el temario deja de medir capacidad para medir memoria.

Los intentos de arreglarlo han ido por la vía contractual. El evaluador firma que no publicará las preguntas, el laboratorio firma que no las buscará. Funciona hasta que alguien tiene un incentivo suficiente para que no funcione, y en un mercado donde un punto de benchmark mueve titulares y valoraciones, el incentivo es considerable.

Lo que propone este piloto es sustituir la promesa por matemáticas. Si el evaluador no puede acceder a los pesos y el laboratorio no puede acceder a las pruebas, la contaminación deja de depender de la buena fe de nadie.

Quién está dentro

La lista de participantes es la parte que da credibilidad. El Singapore AI Safety Institute aporta el papel de organismo público independiente, y MLCommons es la organización detrás de MLPerf, la referencia estándar en medición de rendimiento. OpenMined lleva años trabajando en computación sobre datos privados, que es exactamente la tecnología que hace falta aquí.

Que el modelo del piloto sea un Gemini Flash Lite dice que esto es una prueba de fontanería, no un anuncio de resultados. No están enseñando que su mejor modelo gana un examen: están probando si el mecanismo aguanta.

Por qué el doble ciego es difícil aquí

En un ensayo clínico, el doble ciego se consigue con etiquetas y sobres cerrados. Con un modelo de IA el problema es más incómodo, porque las dos partes tienen algo que no quieren enseñar y que a la vez hace falta para la prueba.

El laboratorio no va a entregar los pesos de su modelo, que son el activo entero de la empresa. Y el evaluador no puede enviar sus preguntas, porque en cuanto salen de su control dejan de ser confidenciales para siempre: una vez que un benchmark se filtra, ya no vuelve a medir nada.

Lo que hacen los espacios criptográficos seguros es permitir que el cálculo ocurra sin que ninguna de las partes vea la información de la otra. El modelo responde a las preguntas y salen los resultados, pero ni Google ve el examen ni el evaluador ve los pesos. Ahí está lo interesante técnicamente, y también el motivo de que se pruebe primero con un modelo pequeño: hacer eso con garantías criptográficas cuesta cómputo.

Por qué importa

Para quien elige modelo en una empresa, la conclusión práctica es la de siempre, ahora con respaldo: los benchmarks públicos no sirven para decidir. Ni con contaminación ni sin ella, porque miden capacidad general y tú necesitas saber si funciona en tus documentos, con tu vocabulario y tus casos raros.

Lo que sí cambia si este mecanismo se generaliza es la comparación entre proveedores. Cuando las cifras que publican los laboratorios estén verificadas por un tercero que no pudo ver el modelo, la tabla comparativa vuelve a valer algo. Mientras tanto, el único benchmark fiable sigue siendo el que montas tú con cincuenta casos reales de tu operación.

Fuente original: Google DeepMind


Relacionado