Anthropic abre 250.000 chats de Claude a Stanford y Oxford

Anthropic abre 250.000 chats de Claude a Stanford y Oxford
Fuente: anthropic.com

Anthropic ha dejado que tres grupos de investigación de fuera miren dentro de Claude. En un post publicado el 26 de agosto, la compañía cuenta que abrió su herramienta interna de análisis, Anthropic Insights (antes Clio), a Stanford, Oxford y METR, con una muestra de unas 250.000 conversaciones de abril y mayo de 2026.

El primer hallazgo publicado es el que más debería interesarte: más de la mitad de esas conversaciones eran gente delegando en la IA tareas con consecuencias reales.

Puntos clave

  • 250.000 conversaciones de Claude.ai y Claude Code, de abril y mayo de 2026.
  • Tres grupos: el SALT Lab de Stanford, el Human Information Processing Lab de Oxford y METR.
  • Los investigadores nunca vieron una conversación entera, solo salidas agregadas.
  • Stanford: más de la mitad de las conversaciones implican delegar tareas de consecuencia real.
  • Stanford: en casi tres cuartas partes, la persona marca la dirección y Claude ejecuta.
  • Menos del 5% de categorías y conversaciones tocaban incumplimientos de la política de uso.
  • Auditoría de privacidad externa a cargo del Imperial College London.

Qué han encontrado los tres grupos

El de Stanford es el que ya tiene números publicados y el que más dice sobre cómo se usa esto de verdad en el trabajo.

Más de la mitad de las conversaciones no son juegos ni pruebas. Son decisiones con peso: asuntos legales, financieros, cosas que si salen mal cuestan dinero o problemas. Y el reparto de papeles es el interesante: en casi tres de cada cuatro conversaciones la persona pone el rumbo y Claude hace el trabajo. No es el modelo decidiendo solo, es alguien delegando ejecución.

Ese matiz vale más que cualquier titular sobre autonomía. La gente ya se fía de la IA para hacer, no todavía para decidir.

El grupo de Oxford sigue con el análisis. Su línea va por los patrones emocionales dentro de las conversaciones, y de momento solo hay resultados preliminares.

METR está midiendo lo que a un equipo técnico le importa: cuánto acelera de verdad la programación. Su conclusión de momento es que los modelos nuevos muestran una aceleración significativa, y siguen trabajando en cuantificarla. Es la misma organización que aparece en las evaluaciones independientes de los últimos meses, así que el dato tendrá comparativa histórica cuando salga.

Y hay una cifra de seguridad que Anthropic pone por delante: menos del 5% de categorías y conversaciones estaban afectadas por incumplimientos de la política de uso. Es su propio dato, con su propia definición de incumplimiento, y conviene leerlo como tal.

Cómo se comparten datos sin abrir conversaciones

Esta es la parte que copiaría cualquiera que maneje datos sensibles.

Insights no entrega texto. Agrupa conversaciones por temas y patrones y devuelve salidas agregadas, y es sobre esas salidas sobre lo que trabajaron los tres grupos. Nadie de fuera abrió un chat.

Encima de eso hay tres capas más: revisión legal y de privacidad antes de entregar nada, una auditoría de privacidad hecha por un tercero, el Imperial College London, y un contrato que limita para qué se puede usar el acceso, con revisión centrada en privacidad, incumplimientos y exactitud.

El acceso para nuevos grupos se pide por formulario.

Merece la pena señalar lo obvio: esto sale caro y no da ingresos. Anthropic lo hace en un momento en el que está firmando cosas como los 45.000 millones de cómputo con Nscale, así que la transparencia con universidades sale prácticamente gratis en su cuenta de resultados y compra bastante en la conversación regulatoria. Las dos cosas pueden ser verdad a la vez.

Por qué importa si metes Claude en tu empresa

Aquí va lo que yo me llevo.

Ese "más de la mitad son tareas de consecuencia real" es un aviso, no una medalla. Significa que en tu empresa, si tienes Claude desplegado, alguien ya lo está usando para algo que si sale mal se nota. Probablemente sin que tú lo sepas y sin ningún registro.

La pregunta operativa no es si la gente lo usa. La usa. La pregunta es si sabes para qué.

En DigitalBrain y en Barner esto se resuelve de una forma poco glamurosa: cada cosa que de verdad importa pasa por un proceso escrito, con su fichero de instrucciones y su revisión humana en el punto donde puede doler. Lo mismo que hacemos con los agentes de ventas dentro del CRM: la herramienta ejecuta, la persona firma.

Y hay una segunda lectura, la del dato de los tres cuartos. Si en el 74% de los casos el humano marca la dirección, la ventaja competitiva no está en tener el modelo. La tiene todo el mundo. Está en la calidad de la dirección que le das, que es otra manera de decir en cuánto contexto tienes ordenado antes de abrir el chat.

Cómo saber qué está pasando en tu casa

Si el dato de Stanford te ha dejado con la duda, hay una versión pequeña y barata de este mismo ejercicio.

Empieza por dónde queda registro. Si tienes plan de empresa, tienes consola de administración y ahí ves volumen por usuario y por equipo, aunque no el contenido. Con eso ya sabes quién lo usa a diario y quién no lo ha abierto nunca, que suele ser la mitad de la plantilla.

Sigue por lo que no queda registrado. La conversación importante casi nunca ocurre en la herramienta que has comprado, ocurre en la cuenta personal de alguien que tenía prisa. Preguntarlo de frente y sin castigo saca más información que cualquier auditoría.

Y termina por lo que sí puedes exigir: que toda tarea con consecuencia deje rastro. Un fichero, un commit, un correo, lo que sea. Si un análisis financiero o una respuesta a un cliente ha pasado por un modelo y no hay ni una línea que lo diga, el problema no es la IA. Es que no hay proceso.

Lo que no dice el estudio

Tres cosas que faltan y conviene no rellenar a ojo.

No hay número absoluto de cuántas de esas tareas de consecuencia salieron bien. Saber que la gente delega asuntos legales no dice nada sobre si el resultado era correcto.

No hay desglose por país ni por idioma en lo publicado, así que no se puede extrapolar al mercado hispano sin más.

Y la muestra es de abril y mayo. En este sector, cuatro meses son mucho tiempo.

Aun así, es el primer conjunto de datos de uso real de un modelo de frontera analizado por gente de fuera de la empresa que lo fabrica. Eso solo ya es raro.

Fuente original: Anthropic


Relacionado