AMD compra Taalas, la startup que graba los modelos de IA directamente en el chip

AMD compra Taalas, la startup que graba los modelos de IA directamente en el chip
Fuente: siliconangle.com

AMD ha comprado Taalas, una startup de Toronto que fabrica chips de inferencia con una idea poco ortodoxa: en lugar de cargar los pesos del modelo desde memoria, los graba directamente en los transistores. La operación se anunció el 6 de agosto y AMD no ha querido dar el precio.

Es la tercera compra de AMD en nueve meses y llega siete meses después de que Nvidia se llevara Groq por 20.000 millones de dólares. Los dos fabricantes están comprando lo mismo: velocidad de inferencia.

Puntos clave

  • Taalas hornea los pesos y el flujo de datos del modelo en el silicio. Sin memoria HBM de por medio.
  • Su chip de prueba HC1, en el proceso de 6 nanómetros de TSMC, corrió Llama 3.1 8B a cerca de 17.000 tokens por segundo.
  • En febrero, la compañía dijo que eso era 73 veces lo que da un H200 de Nvidia con una décima parte del consumo.
  • El segundo diseño, HC2, apunta a modelos de unos 20.000 millones de parámetros.
  • AMD integrará la tecnología en sus GPU Instinct, los racks Helios, los procesadores EPYC y el software ROCm.

Qué hace exactamente Taalas

Un acelerador normal, sea una GPU de Nvidia o una Instinct de AMD, es un chip programable. Los pesos del modelo viven en memoria de alto ancho de banda (HBM) y viajan al núcleo de cómputo en cada paso. Ese viaje es el cuello de botella de la inferencia moderna, y también el motivo de que la HBM se haya convertido en el componente más escaso de la industria.

Taalas se salta el viaje. Diseña un circuito integrado específico por modelo, con los pesos convertidos en estructuras físicas dentro del chip. El modelo deja de ser software cargado en un procesador y pasa a ser el procesador.

La contrapartida es evidente: un chip así solo sirve para el modelo que lleva dentro. Si sale una versión nueva, hace falta silicio nuevo. Es una apuesta a que unos pocos modelos van a concentrar el grueso de las peticiones el tiempo suficiente como para amortizar una máscara de fabricación.

Esa apuesta es menos temeraria de lo que suena. En los dos últimos años, el tráfico de inferencia se ha ido concentrando en una decena larga de modelos que se quedan en producción meses. Y en el mundo abierto, las familias Llama y Qwen se han convertido en estándares de facto que las empresas despliegan tal cual, sin ajuste fino, durante trimestres enteros.

El otro argumento a favor es la escasez de HBM. Es el componente que más limita hoy la producción de aceleradores, y su precio no baja. Un diseño que prescinde de ella se salta la cola entera del proveedor.

Los números que enseñaron

La cifra que puso a Taalas en el mapa la publicó la propia compañía en febrero: el HC1 sirviendo Llama 3.1 8B a casi 17.000 tokens por segundo, que según ellos son 73 veces un H200 de Nvidia consumiendo diez veces menos. Son datos de fabricante sobre un chip de prueba y un modelo de 8.000 millones de parámetros, no un benchmark independiente sobre cargas de producción.

El HC2, el siguiente diseño, sube el listón a modelos de unos 20.000 millones de parámetros. Ahí empieza a haber modelos que las empresas usan de verdad para clasificación, extracción y agentes baratos.

Taalas levantó 169 millones de dólares en febrero con Quiet Capital, Fidelity y el veterano inversor Pierre Lamond, hasta un total de 219 millones. Su cofundador y consejero delegado, Ljubisa Bajic, dirigió antes Tenstorrent.

Qué gana AMD

Vamsi Boppana, vicepresidente sénior del grupo de IA de AMD, ha enmarcado la compra en dar "la solución de cómputo adecuada para cada carga de trabajo de IA". Traducido: AMD quiere tener GPU generalistas para entrenamiento y silicio dedicado para servir los modelos más pedidos, y venderlo todo dentro del mismo rack.

Encaja con lo que la compañía lleva haciendo todo el año. En julio presentó Helios, su primer sistema de rack para IA, con Microsoft Azure como cliente, y en el segundo trimestre dobló el negocio de centros de datos hasta 6.700 millones de dólares. Taalas es la pieza que faltaba en la parte de inferencia.

Antes de esta compra ya se había llevado MK1 en noviembre, Mext en junio y FastFlowLM en julio. Tres de cuatro tienen que ver con servir modelos, no con entrenarlos.

También encaja con su otro movimiento del verano: en julio invirtió hasta 5.000 millones de dólares en Anthropic para levantar 2 gigavatios de cómputo en 2027. AMD lleva un año comprando a la vez capacidad, clientes y tecnología de inferencia.

El pulso con Nvidia se ha movido de sitio

Durante tres años la competición fue por el entrenamiento, y ahí Nvidia ganó por el software antes que por el silicio: CUDA tenía una década de ventaja y todo el mundo escribía contra CUDA.

El terreno de la inferencia funciona distinto. Servir un modelo es una carga mucho más acotada que entrenarlo, con menos superficie de API, y eso reduce la ventaja de tener las bibliotecas de software más maduras. Por eso Nvidia pagó 20.000 millones por Groq en enero y por eso AMD compra Taalas ahora.

La pregunta abierta es de plazos. Taalas tiene un chip de prueba en 6 nanómetros y un segundo diseño en el horno. Entre eso y un producto integrado en un rack Helios que un cliente pueda comprar hay, tirando por lo bajo, año y medio.

Por qué importa

El coste por token es la variable que decide si una automatización con IA sale rentable o se queda en demo. Si el silicio dedicado cumple la mitad de lo que promete, el precio de la inferencia de modelos medianos va a bajar de escalón en 2027, y con él el suelo de lo que resulta viable automatizar.

Para una empresa que hoy descarta un proceso porque salen 400 euros al mes en llamadas a la API, ese cambio de precio abre la puerta. Merece la pena tener la lista de procesos descartados por coste a mano, porque los números se van a mover.


Relacionado