Pathway ha presentado BDH-CQ, un modelo de razonamiento de 150 millones de parámetros que resuelve el 29,5% de ARC-AGI-1 por 0,0007 dólares la tarea. GPT-5.6 Luna en modo bajo llega al 34,5%, pero cuesta unos 0,0077 dólares: once veces más por cinco puntos de acierto.
Puntos clave
- 150 millones de parámetros. Para hacerse una idea, los modelos de frontera manejan cifras entre mil y diez mil veces mayores.
- Arquitectura post-transformer. No usa cadena de pensamiento para razonar.
- ARC-AGI-1, pass@2: 29,5% a 0,0007 dólares por tarea frente al 34,5% de GPT-5.6 Luna (Low) a unos 0,0077.
- Zuzanna Stamirowska es consejera delegada y cofundadora.
- Entre los asesores están Łukasz Kaiser, coautor del artículo original del Transformer, Adam Kurzok, ex responsable de producto de Gemini, Jonathan Frankle, jefe científico de IA de Databricks, y Martín Farach-Colton, director del departamento de informática de la NYU.
- La base técnica es su artículo de octubre de 2025, "The Dragon Hatchling: The Missing Link between the Transformer and Models of the Brain" (arXiv:2509.26507).
Qué es ARC-AGI y por qué se elige esta prueba
ARC-AGI mide razonamiento abstracto sobre rejillas de colores: te dan un par de ejemplos de una transformación y tienes que aplicarla a un caso nuevo. Los humanos la resuelven casi sin pensar. Los modelos grandes lo pasan mal, y cuando lo consiguen suele ser a base de generar mucho texto intermedio.
Que un modelo de 150 millones de parámetros se acerque a un modelo de frontera en esa prueba concreta es lo que hace la noticia. No dice que BDH-CQ sirva para escribir un correo o resumir un contrato. Dice que la relación entre tamaño y capacidad de razonar puede no ser la que damos por hecha.
Y el detalle de que no use cadena de pensamiento importa. La cadena de pensamiento es cara porque son tokens que pagas y no ves. Si el razonamiento se puede meter en la arquitectura en vez de en la longitud de la respuesta, la cuenta cambia entera.
Los avales pesan, el resultado todavía no
Tener a Łukasz Kaiser de asesor es una carta de presentación difícil de mejorar: firmó el artículo que inventó la arquitectura que todo esto usa. Frankle en Databricks y Farach-Colton en la NYU tampoco son nombres de relleno.
Dicho eso, esto es un resultado en un benchmark, publicado por la propia empresa, y la comunidad todavía no lo ha reproducido. Pathway afirma además que su arquitectura escala hasta 600.000 millones de parámetros bajando mucho el coste y el consumo. Eso es una promesa, no un resultado.
El historial de arquitecturas alternativas al transformer está lleno de resultados prometedores en pruebas concretas que no aguantaron cuando había que hacer todo lo demás.
Por qué importa
La conversación de coste en IA lleva un año girando alrededor de la misma idea: bajar el precio por token del modelo grande. DeepSeek acaba de avisar de que va a subir el suyo, lo que ya rompió la narrativa de que el precio solo baja.
Esto apunta a otro sitio: usar modelos pequeñísimos para las tareas que son de razonamiento acotado, y reservar el grande para lo demás. Es la misma lógica de enrutado que Nvidia acaba de empaquetar con Switchyard, llevada al extremo.
Para un operador, la lectura útil no es adoptar BDH-CQ mañana. Es dejar de asumir que un problema difícil requiere el modelo más grande. Cada vez más veces requiere el modelo adecuado, y esa diferencia se paga cada mes en la factura.
Relacionado

