Reflection AI lanza Beam, su modelo abierto de 501.000 millones

Reflection AI lanza Beam, su modelo abierto de 501.000 millones
Fuente: reflection.ai

Reflection AI ha presentado Beam, su primer modelo de pesos abiertos: 501.000 millones de parámetros en total, de los que solo 23.000 millones trabajan en cada token. La startup de Brooklyn dice que rinde como el GLM-5.2 de Z.ai en razonamiento avanzado gastando entre 3 y 4 veces menos cómputo, y lo vende como la respuesta occidental a DeepSeek, Qwen y Kimi.

Los pesos todavía no están. Reflection dice que los publicará este mes de octubre junto al informe técnico y la model card, y de momento abre una lista para acceso anticipado mientras termina el red-teaming.

Puntos clave de Beam

  • Arquitectura: mixture-of-experts (MoE) disperso, 501.000 millones de parámetros, 23.000 millones activos por token, solo texto y ventana de contexto de 1 millón de tokens.
  • Entrenamiento: 23,8 billones de tokens de preentrenamiento y una fase de aprendizaje por refuerzo con más de 100 millones de rollouts en 10.500 GPU Nvidia GB300 durante cuatro semanas.
  • Resultados que declara: 80,9 en SWE-Bench Verified, 80,1 en Terminal Bench 2.1, 90,5 en GPQA Diamond y 97,8 en AIME 2026.
  • La empresa: fundada en 2024 por dos exinvestigadores de Google DeepMind, unos 4.700 millones de dólares levantados según PitchBook y una valoración de 25.000 millones antes del dinero de su última ronda.

Qué es Reflection y por qué tardaba tanto

Reflection AI la fundaron en 2024 Misha Laskin e Ioannis Antonoglou, los dos salidos de Google DeepMind. Desde el principio prometió lo mismo: un laboratorio de frontera estadounidense que publica los pesos de sus modelos. Con ese discurso ha atraído a Nvidia, Sequoia Capital y Lightspeed.

El problema era que no enseñaba nada. Su primer modelo grande tenía fecha orientativa a principios de 2026 y se fue retrasando, mientras la valoración subía. Este verano firmó acuerdos por más de 7.000 millones de dólares con SpaceX y Nebius para tener acceso a chips GB300 de Nvidia hasta 2029. Axios adelantó el fin de semana que el lanzamiento estaba cerca, y el lunes 5 de octubre llegó el anuncio.

Beam es la primera prueba de que ese dinero se ha convertido en un modelo. Falta la segunda prueba, que es que cualquiera pueda descargarlo y medirlo.

Cómo se compara con los modelos abiertos chinos

Reflection publica una tabla larga y, para ser una tabla de la propia empresa, bastante honesta. Beam no gana en todo.

En programación agéntica saca 80,1 en Terminal Bench 2.1, casi empatado con el 81,0 de GLM-5.2, pero lejos del 88,3 de Kimi K3 y del 90,6 de DeepSeek V4.1 Flash. En Humanity's Last Exam sin herramientas se queda en 36,2, frente a 46,9 de Kimi K3. La propia Reflection lo dice en el anuncio: los modelos abiertos de frontera como Kimi K3 siguen por delante en capacidad bruta.

Donde sí saca pecho es en eficiencia. Su argumento es que consigue resultados del nivel de GLM-5.2 (unos 744.000 millones de parámetros, 40.000 millones activos) con muchos menos parámetros activos y menos tokens generados por respuesta. La cuenta que usan es aproximada: multiplican por dos los parámetros activos y por los tokens que genera el modelo en cada intento. No incluye la lectura del prompt ni el coste real de servirlo, y la propia empresa lo avisa.

En uso de herramientas, la cifra que más me interesa es MCP Atlas, una prueba de llamadas a servidores MCP: 78,7, por encima de GLM-5.2 (77,8) y por debajo de Kimi K3 (82,3) y Qwen 3.8 Max (84,5). Es justo el tipo de tarea que hacen los agentes que se conectan a un CRM o a un ERP.

Contra rivales occidentales, Beam supera a Inkling, el modelo abierto de Thinking Machines Lab, en los cuatro tests de código donde los dos publican resultado. Ojo con esa comparación: Inkling es multimodal y Beam solo lee y escribe texto.

Ninguna de estas cifras está verificada por terceros todavía.

Qué cambia técnicamente

La parte del anuncio que más tiempo me ha llevado leer es la del aprendizaje por refuerzo (RL), y es la que explica cómo Reflection ha gastado el dinero.

  • Montaron cerca de un millón de entornos de entrenamiento: tareas de ingeniería de software, terminal, programación competitiva, búsqueda web y trabajo de oficina, filtradas para que no fueran ni triviales ni imposibles.
  • Durante el entrenamiento mantuvieron una media de 110.000 rollouts simultáneos y llegaron a 170.000 sandboxes a la vez. En total, unas 1.300 millones de sandboxes.
  • Entrenaron de forma totalmente asíncrona: el modelo aprende de interacciones generadas hasta un día antes, con 107 versiones de pesos de diferencia, sin que el entrenamiento se desestabilice.

Para comparar, según la propia Reflection, Inkling se entrenó con 30 millones de rollouts. Beam pasa de 100 millones, y la empresa dice que las curvas seguían subiendo cuando pararon.

Hay un detalle práctico que sí cambia el uso diario: Beam tiene un parámetro de esfuerzo de razonamiento. Con el valor bajo responde corto y barato, y con el alto piensa más para tareas difíciles. Es el mismo control que ya tienen los modelos cerrados de OpenAI y Anthropic, y en un modelo abierto te permite ajustar el gasto de GPU por tarea.

Entre las demos, Beam afinó un modelo Gemma 4 pequeño para convertir texto en SQL y subió su precisión un 66,5% en el conjunto de prueba. Lo hizo leyendo él solo la documentación de Unsloth desde OpenCode.

La jugada comercial: fábricas de IA para empresas y países

El cliente de Reflection es la empresa grande y el Estado. El producto que vende se llama "AI factory": que una institución entrene los modelos de Reflection con sus datos propios y los ejecute en su infraestructura.

Ya lo está probando con el grupo surcoreano Shinsegae como proyecto de IA soberana, y según Axios hay fondos de cobertura y firmas de trading interesadas. Jensen Huang lleva tiempo defendiendo esa misma idea de fábrica de IA, y le conviene: cada fábrica funciona con GPU de Nvidia.

Según SiliconANGLE, los pesos saldrán con licencia Apache 2.0, que permite uso comercial sin pedir permiso. Si se confirma, Beam entra en la misma liga de licencia que los modelos de Qwen, que ya acumulan 3.000 millones de descargas.

Por qué importa

Para una empresa española que hoy usa Claude o ChatGPT por API, mañana sigue todo igual: Beam todavía no se puede descargar.

Donde entra es en la conversación de "queremos el modelo en casa". Hasta ahora, si querías un modelo abierto de primer nivel para programar o para agentes, la lista era casi entera china: GLM-5.3 de Z.ai, Kimi K3, Qwen, DeepSeek V4.1. Muchos departamentos legales y de compras ponen pegas a eso, sobre todo en banca, sanidad y administración pública.

Un modelo estadounidense, con licencia abierta y 23.000 millones de parámetros activos, gasta bastante menos cómputo por token que los gigantes de 2 billones de parámetros (aunque sus 501.000 millones totales siguen pidiendo mucha memoria de GPU). Mi consejo: cuando salgan los pesos, prueba Beam con tus propias tareas antes de creerte la tabla. Coge 20 casos reales de tu operación, pásalos por Beam y por el modelo que usas hoy, y compara coste por tarea resuelta. Esa cifra vale más que cualquier benchmark publicado por el fabricante.

Fuente original: reflection.ai


Relacionado