Microsoft lanza sus propios modelos de imagen y voz para depender menos de OpenAI

Microsoft lanza sus propios modelos de imagen y voz para depender menos de OpenAI
Fuente: microsoft.ai

Microsoft acaba de presentar dos modelos propios: MAI-Image-2.5-Pro para generar y editar imágenes, y MAI-Voice-2-Flash para sintetizar voz. Los dos salen en preview público y, lo importante, ya están sustituyendo a tecnología de terceros dentro de productos que usan millones de personas. Es otro paso de Microsoft para depender menos de OpenAI en la capa de modelo.

Puntos clave

  • MAI-Image-2.5-Pro genera y edita imágenes, con foco en renderizar texto legible dentro de la propia imagen.
  • Queda en segundo puesto de edición de imagen en el ranking de Arena, la clasificación por votos de usuarios.
  • MAI-Voice-2-Flash es dos veces más rápido y un 32% más barato que la versión anterior, con 58 idiomas.
  • Los construye el equipo de superinteligencia de Microsoft AI, no OpenAI.

Qué hacen los modelos

MAI-Image-2.5-Pro apunta a imagen de portada y edición fina. Lo que la empresa vende como salto es el texto dentro de la imagen, ese punto donde los generadores suelen fallar y sacan letras deformes. El director creativo global de WPP, citado por Microsoft, lo llama un avance real. En el ranking de Arena, donde los usuarios votan a ciegas qué salida prefieren, el modelo aparece segundo en edición de imagen.

El precio marca el terreno: 5 dólares por millón de tokens de texto de entrada, 8 por millón de tokens de imagen de entrada y 106 por millón de tokens de imagen de salida.

MAI-Voice-2-Flash va de velocidad y coste. Es dos veces más rápido que MAI-Voice-2 y un 32% más barato, a 15 dólares por millón de caracteres, con prosodia natural y soporte para 58 idiomas a través de la integración con Dragon Copilot.

Dónde ya está funcionando

La parte que un operador debe mirar no es el benchmark, es dónde se ha desplegado. MAI-Image-2.5-Pro ya mueve Bing Image Creator de punta a punta, todo con tecnología propia de Microsoft. En PowerPoint recorta el coste de GPU hasta un 84% frente a GPT-Image-2, el modelo de imagen de OpenAI al que sustituye. En OneDrive subió las tasas de guardado un 26% y bajó la latencia P95 alrededor de un 25%, con una mejora de eficiencia de 2,5 veces.

MAI-Voice-2-Flash cuenta lo mismo por el lado de la voz. En el Contact Center de Dynamics 365 recorta hasta un 89% el coste de GPU, y también corre en Azure Voice Live.

Esos porcentajes son la noticia de verdad. Microsoft no está enseñando una demo, está enseñando la factura: cuánto se ahorra al cambiar un modelo de OpenAI por uno de casa dentro de sus propios productos. Cuando una empresa mueve un producto que usan cientos de millones de personas a su propio modelo, no lo hace por marketing. Lo hace porque los números de coste le salen, y porque quiere el control de la pieza.

Por qué importa

Microsoft lleva meses tejiendo una estrategia de no poner todos los huevos en OpenAI. Hace unos días amplió su acuerdo con Mistral para cómputo y modelos en Europa, y ahora enseña músculo propio con modelos que ya reemplazan piezas de terceros en Bing, PowerPoint y OneDrive.

Para una empresa que construye sobre el stack de Microsoft, esto se traduce en una cosa práctica: cada vez habrá más de una opción de modelo detrás del mismo botón, y la elección se va a decidir por coste y latencia, no por marca. Los números que Microsoft publica (84% menos de GPU aquí, 89% allá) son el tipo de dato que conviene pedirle a cualquiera que te venda una automatización con IA. Si no te enseña el ahorro medido, es humo.


Relacionado