Las AI Overviews de Google fallan el 10% del tiempo: decenas de millones de respuestas erróneas a la hora

Las AI Overviews de Google fallan el 10% del tiempo: decenas de millones de respuestas erróneas a la hora
Fuente: techspot.com

Un estudio encargado por The New York Times puso una cifra encima de la mesa: las AI Overviews de Google, esos resúmenes que aparecen arriba en las búsquedas, aciertan el 90% del tiempo. Suena tranquilizador hasta que haces la cuenta. Google procesa más de 5 billones de búsquedas al año. Ese 10% de error son unos 57 millones de respuestas equivocadas cada hora. Lo detalla Popular Science.

Puntos clave

  • El estudio lo hizo la startup Oumi para el NYT, analizando 4.326 búsquedas con el test SimpleQA.
  • Precisión del 90% (91% con Gemini 3, 85% con Gemini 2), pero solo el 39% de respuestas son fiables del todo.
  • Con 5 billones de búsquedas al año, el 10% de fallo son unos 57 millones de respuestas erróneas por hora.
  • Paradoja de Gemini 3: acierta más, pero sus respuestas sin respaldo en las fuentes subieron del 37% al 56%.
  • Un periodista de la BBC engañó a Google, Gemini y ChatGPT con un bulo; Claude no picó.

Las tres formas en que falla

El estudio detecta de dónde salen los errores. Uno, las fuentes: Facebook y Reddit están entre las más citadas por estos resúmenes, la segunda y la cuarta. Dos, enlaza a webs que no respaldan lo que afirma: solo dos tercios de las afirmaciones tienen soporte real en las fuentes citadas, el tercio restante está inventado. Tres, resume mal información que en origen era correcta.

Hay una paradoja incómoda con la última versión. Gemini 3 acierta más que Gemini 2 (91% frente a 85%), pero sus respuestas 'sin fundamento en las fuentes' saltaron del 37% al 56%. Es decir, se inventa con más confianza mientras acierta un poco más. Sumando acierto y respaldo real, solo el 39% de las respuestas son fiables del todo.

El truco del perrito caliente

El periodista de la BBC Thomas Germain lo demostró con un ejemplo ridículo a propósito. Publicó un post titulado 'Los mejores periodistas de tecnología comiendo perritos calientes', se colocó él primero en un campeonato inventado en Dakota del Sur, y en menos de 24 horas Google, Gemini y ChatGPT lo servían como hecho contrastado. Claude, de Anthropic, fue el único que no picó.

El detalle no es la anécdota, es lo fácil que resulta envenenar la información que estos sistemas dan por buena. Si alguien publica un bulo bien colocado, el resumen automático lo puede repetir a millones de personas.

Conviene entender el test. SimpleQA son preguntas de respuesta corta y verificable, el escenario más fácil que existe para un buscador. Que las AI Overviews fallen un 10% ahí, en lo sencillo, es justo lo que enciende las alarmas: en preguntas ambiguas o de opinión el margen de error será mayor. Google defiende que la mayoría de sus respuestas son útiles, pero el estudio mide algo más incómodo, si la respuesta es a la vez correcta y está respaldada por las fuentes que cita.

Por qué importa para un founder español

Si usas un chatbot para investigar competidores, regulación o cifras de mercado, verifica antes de actuar sobre lo crítico. La IA busca más rápido que tú y encuentra cosas que no verías, pero el 39% de fiabilidad total es un número que no puedes ignorar cuando hay una decisión de dinero detrás.

La regla práctica: la IA para explorar y ganar velocidad, la verificación humana para las afirmaciones que van a mover una decisión. No delegues el último paso. Y si el dato viene con fuente, ábrela: un tercio de lo que citan estos sistemas no dice lo que ellos afirman. Ese hábito de abrir la fuente es lo que separa usar la IA bien de tragarte un error caro.


Relacionado