Claude diseñó proteínas por su cuenta y funcionaron en 14 de las 15 dianas

Claude diseñó proteínas por su cuenta y funcionaron en 14 de las 15 dianas
Fuente: anthropic.com

Anthropic ha publicado una investigación en la que sus modelos corrieron campañas de diseño de proteínas de principio a fin y produjeron moléculas que funcionaron en el laboratorio. En 14 de las 15 dianas probadas salió al menos un binder confirmado, con tasas de acierto por encima de lo que se considera normal en el sector.

Cuatro días antes, Dario Amodei había escrito en X que esperaba ver "los primeros destellos en los próximos meses" del trabajo de Anthropic en biología. Llegó antes.

Qué hicieron exactamente

Un binder es una proteína diseñada para agarrarse a otra molécula concreta. Es el primer paso de una parte grande del descubrimiento de fármacos: si consigues algo que se pega a la diana correcta y solo a esa, tienes por dónde empezar.

El montaje fue este. A los modelos (Mythos Preview y Opus 4.8) se les dio un único prompt escrito por un experto, acceso a internet y herramientas. A partir de ahí corrieron solos: eligieron estrategia, generaron candidatos, los filtraron y decidieron cuáles mandar a fabricar.

El trabajo húmedo no lo hizo Anthropic. Twist Bioscience y Adaptyv Bio sintetizaron los candidatos en sus propios laboratorios y midieron los resultados. Esa separación importa: quien mide no es quien diseña.

Los números:

  • 1.320 diseños generados, 354 binders confirmados.
  • Tasa de acierto del 26,7% con Mythos Preview en modo multi-diana y 22,6% con Opus 4.8.
  • En modo diana única, con 24 horas de cómputo por diana, Mythos Preview llegó al 35,1%.
  • La referencia que da Anthropic para el sector está en 10-15%.
  • En la diana RBX1 el acierto fue del 40%, frente al 3,7% de media en la competición de referencia.

En al menos seis dianas salieron binders de alta afinidad, y en cuatro los resultados superaron lo publicado hasta ahora.

Lo que no salió

Dos dianas se atragantaron. BBF-14 dio un 0% de acierto y MBP se quedó alrededor del 3%. De 16 dianas seleccionadas al principio, una se excluyó porque los datos no fueron concluyentes.

Que estén los fallos en el informe es lo que hace creíble el resto. Una campaña que acierta en todo suele significar que las dianas estaban elegidas para acertar.

El detalle que se está pasando por alto

Hay una segunda parte del trabajo que ha tenido menos ruido y que es igual de interesante para cualquiera que dirija una operación.

Le dieron a Opus 5 ficheros crudos de instrumentos de laboratorio, sin el software propietario que normalmente los interpreta. Los leyó directamente. Procesó un espectro de resonancia magnética nuclear en 23 minutos y un LC-MS en 19. Midió una pureza del 96,4% donde el laboratorio, con su cadena habitual, había medido 96,33%. El estándar del sector para ese tipo de análisis está entre 30 minutos y una hora por muestra.

Es lo mismo que pasa cuando pones un modelo delante de un export en bruto de un ERP en vez de delante del informe ya cocinado. La capa intermedia de software, que existía porque un humano necesitaba una interfaz, deja de ser obligatoria.

Lo que cuesta

Anthropic publica el consumo, y se agradece. El modo multi-diana corrió 48 horas de reloj con hasta 12.500 horas de H100. El modo de diana única, 24 horas por diana con hasta 2.500 horas de H100 cada una.

No es barato. Pero comparado con lo que cuesta una campaña de diseño de binders convencional, con su equipo y sus meses, la cuenta cambia de sitio.

Quién más juega en este terreno

Conviene poner el resultado en su sitio, porque el diseño de proteínas con IA no lo inventó Anthropic esta semana.

Hay herramientas especializadas desde hace años, entrenadas específicamente para predecir estructuras o generar binders. Isomorphic Labs, la filial de Alphabet nacida de AlphaFold, trabaja en esto con financiación de miles de millones. Hay modelos de proteínas de código abierto que cualquier laboratorio puede correr. Y las competiciones de diseño de binders, como la que Anthropic usa de referencia para el 3,7% en RBX1, existen precisamente porque el sector lleva tiempo midiéndose.

Lo que cambia aquí es el tipo de herramienta que consigue el resultado. Un modelo entrenado para hacer una sola cosa muy bien contra un modelo generalista al que le das un prompt, herramientas y dos días de cómputo.

Y hay un matiz honesto que Anthropic no esconde: los binders diseñados se sintetizaron y midieron en laboratorios ajenos con métodos estándar. No hay ninguna magia nueva en la validación. Lo que se está midiendo es la calidad de las propuestas, no una técnica de medición distinta.

Por qué importa fuera de la biotecnología

Lo relevante no es que un modelo diseñe proteínas. Eso ya lo hacen herramientas especializadas, entrenadas para eso y solo para eso, desde hace años.

Lo relevante es que aquí el trabajo lo hizo un modelo generalista, con un prompt, herramientas y permiso para correr solo durante dos días. Sin fine-tuning para la tarea. Sin un pipeline construido a medida.

Ese es el patrón que llevamos meses viendo en cosas mucho menos épicas: el modelo generalista con buenas herramientas y buen contexto empieza a comerse el terreno de la herramienta especializada. Pasó con la extracción de documentos, está pasando con el análisis de datos, y ahora aparece en un dominio donde el listón es una medición de laboratorio, no la opinión de nadie.

Para un operador la lectura práctica es corta. Antes de encargar una herramienta específica para un problema, merece la pena probar cuánto llega un modelo bueno con acceso a las herramientas correctas y tiempo para trabajar. En bastantes casos la respuesta va a incomodar a quien iba a vender la herramienta.

Las tres condiciones que hicieron que funcionara

Y aquí está la parte que sí se puede copiar, porque no tiene nada que ver con proteínas.

Le dieron tiempo. 48 horas de reloj. Casi todo lo que la gente prueba con modelos se juzga en una conversación de cinco minutos. Un agente que puede iterar, fallar y volver a intentarlo durante dos días es otra herramienta, aunque el modelo sea el mismo.

Le dieron herramientas de verdad. Acceso a internet y a las utilidades del dominio. Sin eso, el modelo solo puede opinar desde lo que memorizó. Con eso, puede comprobar.

Le dieron un criterio de éxito medible fuera del modelo. Los binders se sintetizan y se miden en un laboratorio. No hay forma de que el sistema se autoengañe: o la molécula se pega o no se pega.

Esa tercera es la que casi nadie monta, y es la que decide si un agente sirve. En una empresa el equivalente es tener una métrica que el propio agente no controle: el pedido se procesó correcto o no, la factura cuadró o no, el cliente respondió o no. Si el único juez de la calidad del trabajo es otra llamada al mismo modelo, no estás midiendo nada.

Dos días de cómputo, herramientas y una prueba externa. Ese es el montaje. El modelo es la parte que ya viene hecha.


Relacionado