ChatGPT, Claude y Grok dejaron de responder a la vez este jueves, en una ventana de un par de horas que dejó a los tres grandes asistentes fuera de juego al mismo tiempo. Tres días de septiembre y ya tenemos el primer recordatorio de que casi todo el trabajo con IA de una empresa media cuelga de tres APIs que no controla.
Puntos clave
- Grok fue el primero en caer, a las 9:30 hora del Este (15:30 en España), en la app de Android, en la de iOS y en la web.
- ChatGPT empezó a devolver errores hacia las 11:00 ET (17:00 en España). La página de estado de OpenAI hablaba de "errores elevados en ChatGPT y Codex".
- Claude, Claude Code y la API de Anthropic cayeron en la misma franja. CJ Avilla, del equipo técnico, lo atribuyó a un problema de infraestructura y dio el incidente por resuelto sobre las 12:15 ET.
- Nadie ha dicho qué pasó. Las tres empresas no respondieron a la petición de comentarios de The Verge.
Qué se rompió exactamente
En OpenAI el fallo no se quedó en el chat. Con los errores caían también los inicios de sesión, la subida de archivos, el modo voz, la búsqueda, deep research y la generación de imágenes. Es decir, prácticamente toda la superficie de producto. La compañía dijo haber aplicado una mitigación y estar "monitorizando la recuperación", con rendimiento aún degradado mientras The Verge publicaba.
En Anthropic el reparto fue distinto y más molesto para quien programa: se llevó por delante el chat, Claude Code y la API a la vez. Si tienes agentes corriendo contra la API, ahí no hay plan B dentro de casa.
En xAI, Grok devolvía en X un mensaje que ya conoce cualquiera que use modelos en hora punta: "Este modelo está sobrecargado ahora mismo. Prueba de nuevo en un rato o elige otro modelo". El aviso en la web de Grok decía que estaban trabajando en restaurar el servicio lo antes posible.
Varios medios metieron también a Gemini en la lista. Ni Google ni la cobertura de The Verge lo confirman, así que de momento son tres y no cuatro.
Coincidencia o causa común
Aquí toca ser honesto: no se sabe. The Verge lo dice con todas las letras, que no está claro qué ha fallado ni si los problemas están relacionados.
Hay dos explicaciones posibles y ninguna está confirmada. Una es la casualidad, que existe y es más frecuente de lo que parece cuando tres servicios enormes tienen incidentes cada semana. La otra es un proveedor compartido debajo: red, DNS, un CDN, una región de nube concreta. Los tres corren sobre infraestructuras distintas en la capa de cómputo, pero comparten bastante en las capas de entrada.
El reloj juega en contra de la teoría de la causa común. Grok empezó a fallar hora y media antes que ChatGPT, y Anthropic dio su incidente por cerrado a las 12:15 ET, cuando OpenAI seguía con rendimiento degradado. Si hubiera un único proveedor debajo cayéndose, lo esperable sería un solapamiento más limpio en el arranque y en la recuperación.
El contexto tampoco ayuda a leerlo con calma. OpenAI lleva días calentando el lanzamiento de Astra, su siguiente modelo, y un pico de tráfico anticipado es justo el tipo de cosa que hace saltar errores elevados. Es una hipótesis, no un dato.
Lo que sí es un dato es que las tres empresas han pasado el día sin decir nada más allá de la página de estado. Para un cliente que paga por API, esa opacidad es parte del problema: sin causa raíz publicada no hay forma de saber si mañana vuelve a pasar.
Por qué importa
Si un proceso de tu empresa depende de una sola API de IA, hoy has visto cuánto vale ese proceso cuando la API no está.
La pregunta útil es qué pasa en tu sistema cuando el modelo devuelve un 503 durante noventa minutos.
Hay tres respuestas posibles y conviene saber cuál es la tuya. La mala es que el proceso se cae y alguien lo descubre por la mañana leyendo un log. La regular es que se cae y te avisa. La buena es que reintenta con espera creciente, y si sigue sin haber servicio se pasa a un modelo alternativo de otro proveedor o se queda en cola sin perder el trabajo.
Hoy la tercera opción era la única que salvaba la tarde, porque los tres grandes cayeron dentro de la misma ventana. Un reintento contra el mismo proveedor durante hora y media no habría servido de nada, y una cola que aguante el trabajo hasta las 18:15 sí.
Montar eso son tres piezas: un `try` con reintentos, una variable de entorno con un segundo proveedor y una cola donde aparcar lo que no salió. Media mañana bien invertida para cualquiera que ya tenga automatizaciones en producción.
Lo mismo aplica a la parte manual. Un equipo que trabaja con ChatGPT todo el día se queda parado un martes cualquiera si no tiene una segunda cuenta en otro proveedor. Cuesta 20 euros al mes tener a Claude o a Gemini de suplente, y hoy esos 20 euros habrían salvado la tarde a bastante gente.
La otra pata, más lenta pero más sólida, es bajar al menos una tarea a un modelo que corra en tu propia máquina. Nvidia acaba de publicar una herramienta gratuita que reparte inferencia entre los ordenadores que ya tienes en la oficina, y para clasificar, extraer datos o resumir no hace falta un modelo frontera.
Fuente original: The Verge
Relacionado


