Writer saca Palmyra X6 y mide su modelo por coste por tarea terminada, no por token

Writer saca Palmyra X6 y mide su modelo por coste por tarea terminada, no por token
Fuente: writer.com

Writer ha presentado Palmyra X6, su modelo insignia para trabajo agéntico. La cifra que pone por delante no es una puntuación de benchmark: es 0,12 dólares de coste medio por tarea terminada, un 52% menos que su generación anterior.

Es un cambio de unidad de medida que merece atención, aunque venga con los asteriscos de siempre.

Puntos clave

  • Coste medio por tarea terminada de 0,12 dólares, un 52% menos que la generación anterior.
  • Puntuación de capacidad de 0,87, la más alta en un campo de seis modelos según su propia evaluación.
  • Mantiene un objetivo hasta 8 horas sin intervención y devuelve trabajo terminado.
  • Dice ser 9,4 veces más barato en salida que Claude Opus 4.8, con un precio mezclado de 3,50 dólares por millón a una proporción 3:1 entre entrada y salida.
  • Las nueve capacidades que mide salen del trabajo real de sus clientes, no de un test estándar.

Por qué la unidad importa

Comparar modelos por precio por millón de tokens tiene un problema que cualquiera que haya presupuestado esto conoce: el modelo barato puede salir más caro si necesita tres intentos para terminar la tarea, y el caro puede salir barato si la acaba a la primera.

El precio por millón es un dato de proveedor. El coste por tarea terminada es un dato de operación. Writer ha decidido comunicar con el segundo, y eso obliga a definir qué cuenta como tarea terminada, que es donde está el juicio.

Ellos lo definen así: nueve capacidades sacadas del trabajo de producción que corren sus clientes (marketing, ingresos, investigación, prospección), puntuadas de 0 a 1. Afirman haber mejorado en las nueve.

Las ocho horas

El otro número del lanzamiento es la resistencia: un solo objetivo, hasta 8 horas, sin intervención, devolviendo trabajo acabado en vez de un borrador.

Es la misma dirección que se ve en todo el sector. La conversación de ida y vuelta se está quedando para consultas; el trabajo de valor se está moviendo a encargos largos donde defines el objetivo, los criterios de aceptación y las fuentes, y vuelves horas después.

También publican una comparación directa de precio: 9,4 veces más barato en salida que Claude Opus 4.8, con un precio mezclado de 3,50 dólares por millón a una proporción típica de 3 a 1 entre entrada y salida.

El asterisco

Todo lo anterior sale de la evaluación de Writer sobre el trabajo de Writer con sus clientes. No hay nadie de fuera que lo haya replicado, y el campo de seis modelos contra el que se compara lo eligieron ellos.

Eso no lo invalida, pero cambia cómo hay que leerlo. Un benchmark hecho sobre tu propio trabajo de producción es más representativo que uno de trivia y menos comparable entre proveedores. Las dos cosas a la vez.

La pata que sí es verificable sin depender de su palabra es la de gobierno: retención cero por defecto, sin entrenar con datos del cliente, autohospedaje y residencia de datos disponibles, guardarraíles que detectan y borran datos personales y revisan contra material con derechos antes de que salga nada, SSO y SCIM, control de acceso granular, registros de auditoría, claves de cifrado gestionadas por el cliente, y alineación declarada con el marco NIST AI RMF y con el Reglamento de IA de la UE.

Por qué importa

Si estás comparando proveedores de IA para tu empresa, cópiale la métrica aunque no le compres el modelo.

Coge tres tareas reales que ya corras en producción. Mide cuánto cuesta terminarlas de verdad con cada modelo, contando reintentos, correcciones y el tiempo de la persona que revisa. Ese número decide, no la tabla de precios.

Nosotros hicimos ese ejercicio hace meses y el resultado fue mixto a propósito: Sonnet para lo sencillo y repetitivo, Opus para lo complejo. Los modelos nuevos suelen salir caros si los mandas a hacer trabajo que resuelve uno más barato. Y salen baratísimos cuando resuelven algo que antes no se podía hacer.

La parte de gobierno importa más de lo que parece si trabajas con datos de clientes europeos. Retención cero por defecto y residencia de datos no son detalles de la ficha técnica, son lo que hace que legal te deje pasar de la prueba al despliegue.


Relacionado