Aleph Alpha lanza Kolibri, modelo abierto de 78.000 millones

Aleph Alpha lanza Kolibri, modelo abierto de 78.000 millones
Fuente: aleph-alpha.com

Aleph Alpha, el laboratorio alemán que en 2024 se apartó de la carrera de los grandes modelos, ha vuelto con Kolibri-1: un modelo abierto de 78.000 millones de parámetros que solo activa 3.460 millones por cada palabra que genera. Lo publicó el 3 de octubre, Día de la Unidad Alemana, con un post técnico en su blog, los pesos completos en Hugging Face y licencia Apache 2.0, que permite uso comercial sin pedir permiso.

Habla dos idiomas, alemán e inglés, y la apuesta es explícita: profundidad en dos lenguas antes que cobertura de muchas. El español no está entre ellas.

Puntos clave

  • Tamaño: 78.103 millones de parámetros en total, 3.458 millones activos por token. Es un *mixture of experts* (MoE): 384 expertos por capa, de los que se encienden 6 más uno compartido.
  • Contexto: validado hasta 1.048.576 tokens, aunque Aleph Alpha recomienda no pasar de 262.144 para tareas complejas o cuando importa la velocidad.
  • Hardware: unos 78 GB en FP8. Cabe en una sola Nvidia H200, B200 o B300, o en dos H100.
  • Rendimiento según la empresa: 96,9 en AIME 2025 (matemáticas) y 84,3 en GPQA Diamond (preguntas de ciencia de nivel doctorado), por delante de Nemotron 3 Super, Mistral Small 4 y Qwen3.6-35B.
  • Licencia: Apache 2.0. Se puede descargar, modificar y desplegar en tus servidores.

Qué ha construido Aleph Alpha

La arquitectura MoE es lo que explica la cifra rara del titular. El modelo guarda el conocimiento de uno de 78.000 millones de parámetros, pero para cada token solo trabaja una fracción pequeña. Eso abarata mucho el coste de servirlo. La contrapartida, que Aleph Alpha reconoce en su ficha técnica, es la memoria: aunque solo use una parte, el modelo entero tiene que estar cargado.

Para que los contextos largos no se coman esa ventaja, la mayoría de capas de atención miran solo el texto cercano y unas pocas leen el documento entero. Y han diseñado un tokenizador pensado para la estructura del alemán, con sus palabras compuestas kilométricas: según la empresa, comprime el alemán mejor que cualquiera de sus competidores (4,90 bytes por token).

El entrenamiento es europeo de principio a fin, y Aleph Alpha lo cuenta con un detalle poco habitual:

  • 768 GPU Nvidia B200 durante 21 días de preentrenamiento, unas 392.000 horas de GPU. Con las fases posteriores, el total ronda las 492.000.
  • 20 billones de tokens de entrenamiento, filtrados a partir de 200 billones en bruto: un 62,5% en inglés, un 23,9% en alemán y un 13,6% de código.
  • Unos 950 MWh de energía estimada, contando la sobrecarga del centro de datos.
  • Equipos y entrenamiento en Alemania y Finlandia, bajo legislación europea. La empresa firmó además el Código de Buenas Prácticas de la UE para modelos de propósito general.

El modelo tiene cuatro niveles de razonamiento (ninguno, bajo, medio y alto) para elegir entre coste y calidad, y sabe llamar a herramientas externas. Su fecha de corte de conocimiento es el 18 de junio de 2026.

Probarlo no es tan inmediato como con otros modelos abiertos. Necesita un complemento propio de Aleph Alpha para vLLM (el paquete `aleph-alpha-inference`, también disponible como contenedor), y una vez levantado expone una API compatible con la de OpenAI. Eso significa que cualquier aplicación que ya hable con ChatGPT por API puede apuntar a un Kolibri instalado en tus servidores cambiando la dirección y poco más. Para quien quiera la versión comercial, con soporte y ajuste a su sector, la vía es hablar con ventas.

Cómo se compara

Aleph Alpha se mide contra modelos MoE de tamaño parecido, y sale bien parado en razonamiento. En AIME 2025 saca 96,9 frente a 91,7 de Nemotron 3 Super, 84,6 de Qwen3.6-35B y 79,8 de Mistral Small 4. En GPQA Diamond, 84,3 frente a 83,4 de Qwen y 78,0 de Nemotron. La empresa dice que iguala a modelos con hasta cuatro veces más parámetros activos.

En código no gana: en HumanEval+ se queda en 92,7, por debajo del 94,7 de Nemotron y casi empatado con Qwen y Mistral (92,8). En SWE-Bench Verified, la prueba de arreglar fallos reales en repositorios, marca 66,4.

Donde más presume es en algo que importa mucho en empresa: saber decir "no lo sé". En su prueba de anclaje sobre SQuAD, Kolibri saca 23,4 puntos donde los rivales comparados sacan 0. Lo han entrenado para abstenerse cuando el documento no contiene la respuesta, en vez de inventarla.

Ojo con todo esto: son números de la propia Aleph Alpha, con su marco de evaluación. Hasta que lo midan terceros, hay que tomarlos como lo que son.

La comunidad, eso sí, se ha lanzado. En dos días ya había más de diez versiones cuantizadas en Hugging Face (GGUF, MLX para Mac, NVFP4) y el repositorio oficial sumaba 1.135 descargas y 443 "me gusta".

Por qué importa

Para una empresa española, Kolibri no es una opción directa: no habla español, y eso descarta casi cualquier caso de cara al cliente. Pero la señal sí cuenta. Europa ya tiene dos laboratorios con modelos abiertos competitivos, Mistral en Francia (que acaba de aliarse con Cloudera para llevar sus modelos a los datos de las empresas) y ahora Aleph Alpha en Alemania.

Los clientes que persigue Aleph Alpha son sector público alemán, aeronáutica, automoción e industria: empresas reguladas que no pueden mandar sus datos a un servidor de Estados Unidos. Para ellas, un modelo que cabe en una sola GPU y se instala en casa resuelve el problema de raíz.

Si trabajas en una multinacional con sede o filial en Alemania, o en una industria regulada, apúntate el nombre. Y si lo que te interesa es la arquitectura, la lección vale para cualquiera: 3.460 millones de parámetros activos dan hoy resultados que hace un año exigían un modelo diez veces más caro de servir.

Fuente original: aleph-alpha.com


Relacionado