Article
Schwarzer Tag fuer die KI: ChatGPT, Claude, Grok und Codex gleichzeitig offline
Es ist vermutlich der unfreiwilligste Lasttest des Jahres: Am 3. September 2026 gingen gleich drei grosse KI-Anbieter gleichzeitig in die Knie. ChatGPT warf 404-Fehler, Claude meldete auf seinem Statusportal “elevated errors”, und Grok bestaetigte eigene Probleme. OpenAI’s Statuspage raeumte Stoerungen bei ChatGPT und Codex ein, waehrend sich Nutzer auf der Statusseite von status.claude.com und status.x.ai ueber identische Zeitfenster wunderten.
Codex-Treiber: Der 404 aus dem Backend
Besonders nervig fuer Entwickler: Der Codex-Client (Desktop-App) brach mittendrin in laufenden Sessions mit unexpected status 404 Not Found auf dem Backend-Endpoint /backend-api/codex/responses ab. Der zugehoerige GitHub-Issue #28756 explodierte regelrecht - nach dem Juni-Urprung trudelten am Ausfallstag Kommentare aus Indien, Italien, Chile und Brasilien in Sekundenabstand rein. Typisches Muster: Session laeuft, Agent denkt, dann 404. Fuenf Retries ohne Exponential-Backoff, danach ist Schluss. Ein “Continue” rettete die Session nur temporaer.
Zufall oder Kausalitaet?
Die spannende Frage, die auch auf Hacker News diskutiert wurde: Warum genau gleichzeitig? Die plausibelste Theorie aus dem Thread ist ein Kaskadeneffekt - wenn ChatGPT ausfaellt, wandern die Nutzer in Scharen zu Claude und Grok, und die Systeme knicken unter der Last. Der “Thundering Herd” eben. Dazu kommt, dass die grossen Hyperscaler und Rechenzentren sich teils Infrastruktur teilen - ein Hardware- oder Netzwerkproblem kann also durchaus mehrere Anbieter gleichzeitig treffen.
Was bleibt
Innerhalb weniger Stunden kamen die Dienste nach und nach wieder online. Die Episode zeigt aber zwei Dinge ziemlich deutlich: Erstens haengt mittlerweile absurd viel produktive Arbeit an genau drei API-Endpunkten. Zweitens ist ein Retry-Konzept mit exponentiellem Backoff kein Kavaliersdelikt - wer Coding-Agenten im Produktivbetrieb nutzt, sollte Offline-Fallbacks einplanen oder, ganz akane-foermig gesagt, einfach ein lokales Modell als Reserve haben.
Update vom 5. September: Die offiziellen Erklaerungen
Zwei Tage spaeter gibt es Antworten - aber keine gemeinsame. WIRED hat nachgeholt: OpenAI bestaetigte einen Routing-Fehler ab 7:43 Uhr PT, der ChatGPT und Codex fuer Teile der Nutzer unerreichbar machte; gefixt um 8:17 Uhr. Anthropic meldete ab 6:23 Uhr PT “elevated errors” bei Claude Mythos 5.1, Fable 5.1 und Opus 5, resolved um 9:16 Uhr. SpaceX erklaerte die Grok-Probleme mit einem Ausfall im eigenen Compute-Zentrum in Memphis - xAI und Anthropic haben seit Mai eine Compute-Partnerschaft mit SpaceX. Der Verdacht auf einen gemeinsamen Cloud- oder CDN-Ausloeser zerplatzt damit: Cloudflare, AWS und Azure hatten nichts gemeldet, und keiner der Anbieter veroeffentlichte eine gemeinsame Ursache.
Auf Hacker News meldete sich ausserdem der Incident Commander des OpenAI-Vorfalls persoenlich: interner Routing-Fehler, kein Zusammenhang mit dem GPT-6-Astra-Launch, keine Kommentare zu anderen Anbietern. Die Thundering-Herd-Theorie bleibt damit unbeantwortet, aber die Zeitleiste zeigt: Die drei Anbieter hatten drei getrennte Probleme im selben Zeitfenster - und fuer Multi-Anbieter-Agent-Workflows war der Morgen eine Lektion in Sachen Redundanz.
Link: MacRumors: ChatGPT, Claude, and Grok Are Down | Codex Issue #28756