xAI ha vuelto a retrasar Grok 4.7. Elon Musk dijo el 11 de septiembre que el modelo necesita "unos días más" de ajuste por refuerzo porque se rinde demasiado pronto en tareas difíciles que sí sabe resolver, según recogió Crypto Briefing. Es el enésimo plazo incumplido desde finales de julio.
Puntos clave
- Musk reconoció el 11 de septiembre que faltan días de ajuste de aprendizaje por refuerzo.
- El problema concreto: el modelo "abandona demasiado pronto tareas difíciles que puede hacer" y no es "suficientemente riguroso comprobando su propio trabajo".
- El ajuste toca las penalizaciones a la longitud de respuesta durante el entrenamiento.
- Grok 4.7 apunta a 2,1 billones de parámetros frente a los 1,5 billones de Grok 4.6. Un 40% más.
- El patrón de retrasos arranca a finales de julio.
- Meta y OpenAI esperan sacar actualizaciones de modelo este mismo mes.
El fallo es más interesante que el retraso
Musk ha descrito un problema técnico bastante específico, y merece la pena entenderlo porque afecta a cualquiera que use modelos de razonamiento.
Cuando entrenas un modelo por refuerzo, lo premias por acertar. Si además lo penalizas por dar respuestas largas, para que no se enrolle, aprendes algo que no querías enseñarle: que rendirse rápido puntúa mejor que insistir.
El resultado es el que describe Musk. Un modelo que tiene la capacidad de resolver una tarea difícil pero que tira la toalla antes, porque el entrenamiento le ha enseñado que el camino corto sale más barato en su función de recompensa.
Lo mismo explica la segunda parte: no comprobar el propio trabajo. Verificar cuesta tokens, y si los tokens penalizan, el modelo aprende a no verificar.
Cuarto plazo incumplido
El 3 de septiembre Musk anunció Grok 4.7 a diez días vista, con 2,1 billones de parámetros y datos de SpaceX en el entrenamiento. Ese plazo se cumplía justo ahora.
Antes hubo otros. La secuencia arranca a finales de julio y es la misma cada vez: fecha pública, fecha incumplida, explicación técnica.
El momento tampoco ayuda. Meta y OpenAI tienen actualizaciones previstas este mes, así que cada semana de retraso es una semana comparándose con modelos más nuevos.
El salto de tamaño no garantiza nada
2,1 billones de parámetros frente a los 1,5 billones de Grok 4.6 es un 40% más de modelo. Suena a mejora automática y no lo es.
Desde 2025 la relación entre tamaño y capacidad se ha ido despegando. Los saltos grandes de los últimos dos años han venido del entrenamiento por refuerzo y del uso de cómputo en el momento de la inferencia, no de meter más parámetros.
De hecho, el problema que Musk describe es exactamente de esa segunda familia. Un modelo un 40% más grande que se rinde pronto sigue rindiéndose pronto. Lo que hay que arreglar está en la función de recompensa, y eso no se resuelve con más GPU.
Ahí está la explicación del retraso. El modelo probablemente ya está entrenado, y lo que falta es el ajuste fino de comportamiento, que es lento y cuesta iteraciones.
El resto de xAI no se para
Mientras el modelo espera, la empresa ha movido otras dos piezas esta semana.
Grok Bot ha estrenado conector con Microsoft Teams, capaz de buscar, leer y enviar mensajes de chats y canales desde el propio flujo del agente. Y en Memphis, xAI ha terminado la mayor batería conectada a red de Estados Unidos con 720 Megapacks de Tesla.
La infraestructura avanza más rápido que el modelo.
Por qué importa
Un retraso de días no cambia nada para nadie. Lo que sí vale es el diagnóstico.
Si en tu empresa hay un agente que abandona tareas a medias, que devuelve respuestas cortas cuando el problema pide detalle, o que no comprueba lo que produce, el origen probablemente sea el mismo: alguien optimizó por brevedad o por coste y el modelo aprendió a hacer menos.
La corrección es sencilla de decir y molesta de aplicar. Si quieres rigor, tienes que pagar los tokens del rigor. Un agente que verifica su trabajo gasta más y falla menos, y esa cuenta hay que hacerla con la factura de los errores delante, no solo con la de la API.
Fuente original: cryptobriefing.com
Relacionado


