OpenRouter, el router que muchas empresas usan para acceder a múltiples modelos con una sola API key, integró el 12 de junio Fusion en su API después de tres meses de experimento público desde marzo. Mandas un prompt y la plataforma lo ejecuta en paralelo en varios modelos frontera (Claude, GPT, Gemini, Kimi, DeepSeek), cada uno con búsqueda y fetch web activados, y un "judge model" sintetiza las respuestas en una sola.
Cómo sintetiza el juez
El modelo juez no elige la mejor respuesta y ya está. Analiza todas: busca puntos de consenso, contradicciones, cobertura parcial, ideas únicas y puntos ciegos, y con eso redacta una respuesta final. En las pruebas de OpenRouter el juez es Gemini 3.1 Pro Preview. Ese detalle importa porque la calidad de Fusion depende tanto del juez como de los modelos del panel.
Los números que publica OpenRouter
Los resultados salen del benchmark DRACO: 100 tareas de deep research en 10 dominios (académico, finanzas, derecho, medicina, tecnología, diseño UX, conocimiento general, retrieval, asistencia personalizada, comparación de producto), evaluadas sobre unos 39 criterios ponderados de exactitud, profundidad, presentación y calidad de citas.
Cuatro cifras cuentan la historia. Fable 5 + GPT-5.5 combinados alcanzan 69,0%. Opus 4.8 solo se queda en 58,8%. Y el dato más revelador: Opus 4.8 fusionado consigo mismo sube a 65,5%, casi 7 puntos solo por sintetizar dos pasadas del mismo modelo. La síntesis por sí sola aporta lift, sin necesidad de diversidad de modelos.
El panel "budget" (Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro) marca 64,7%, a menos de un punto de Fable 5 solo y a la mitad de coste. Es decir, varias opiniones baratas bien sintetizadas rozan a una opinión cara individual. La validación independiente todavía es limitada, y DRACO solo mide tareas en inglés y texto, sin long-horizon. Hay que tomar el dato como punto de partida, no como ley.
Cómo se usa
Dos caminos. Sin código: abres openrouter.ai/fusion y eliges un preset o construyes un panel custom con los modelos que quieras y el juez. Por API: mandas `model="openrouter/fusion"` a cualquier endpoint de inferencia y el plugin se auto-inyecta con un panel default de frontera. La fontanería ya está montada porque miles de empresas usan OpenRouter como router de modelos.
Hay dos costes que pagar. El de dinero: multiplica el de un modelo individual por el número de participantes del panel, más el juez. El de tiempo: cada llamada Fusion tarda 2-3x más que una normal por la ejecución en paralelo y la síntesis. Por eso Fusion está pensado para deep research, tareas críticas o exploración, no para pipelines de alto volumen ni respuestas en tiempo real.
Por qué importa para founders españoles
El año pasado el debate era "qué modelo es mejor". Este año el debate empieza a ser "qué combinación de modelos es mejor", y la respuesta sigue siendo: depende del trabajo. Lo interesante para una empresa española de 10-200 personas no es el benchmark, es la economía. Un panel de tres modelos baratos roza a Opus 4.8 a la mitad de coste. Para deep research y análisis críticos, el cálculo cambia.
Qué hacer
- Si haces deep research o resúmenes legales: prueba Fusion en 20-30 consultas esta semana contra tu modelo actual. Compara calidad subjetiva. El coste por consulta es varias veces el de un solo modelo y tarda 2-3x más, pero el output puede compensar.
- Si tu pipeline es alto volumen y bajo coste por petición: Fusion no es para ti. Multiplicar por 4 el coste de tokens en una pipeline de millones de llamadas mata el margen.
- Si ya pagas Opus 4.8 caro por defecto: prueba el panel budget (Gemini Flash + Kimi + DeepSeek). En DRACO marca casi lo mismo que Fable 5 a la mitad de coste. Si te funciona en tu caso, ahorras.
Relacionado


