xAI wijst Memphis-rekencentrum aan, OpenAI noemt een routeringsfout
De twee bedrijven die donderdagmiddag nog zwegen over de oorzaak hebben inmiddels allebei een verklaring gegeven, en die verklaringen wijzen niet naar elkaar. xAI, dat op X en op zijn eigen statuspagina inmiddels SpaceXAI heet, bood excuses aan voor Grok en weet de uitval aan een storing in ons Memphis-rekencentrum van vanochtend, met excuses aan de getroffen afnemers van zijn rekenkracht en de mededeling dat alle systemen weer draaien. OpenAI liet aan meerdere redacties weten dat een routeringsfout vanaf ongeveer 7.43 uur Pacific Time ChatGPT en Codex voor een deel van de gebruikers onbereikbaar maakte, met een werkende oplossing rond 8.17 uur Pacific Time. Dat is 16.43 en 17.17 uur Nederlandse tijd, precies het begin en de mitigatie uit het eigen incidentlog van OpenAI. Anthropic bevestigde daarnaast dat het infrastructuurprobleem een gedeeltelijke storing veroorzaakte over Claude.ai, Claude Code, Claude Cowork en de Claude-API, met herstel om 16.16 UTC, en ook de statuspagina's van AWS, Google Cloud en Azure toonden geen relevante storing.
Er liggen daarmee drie losse, leverancier-eigen oorzaken op tafel in plaats van een gedeelde laag eronder, al blijft opvallend dat de grote Claude-storing en de Memphis-storing binnen enkele minuten van elkaar begonnen en de routeringsfout bij OpenAI ruim een uur later kwam. Voor een Nederlands bedrijf dat bij uitval doorschakelt naar een tweede AI-aanbieder is dat beter nieuws dan het donderdagavond leek: niets wijst nu op een onderliggende dienst die alle drie tegelijk omtrekt, dus een tweede leverancier houdt wel degelijk waarde. Dat toeval drie storingen toch kan laten overlappen blijft de reden om je proces ook te laten doorlopen op het moment dat geen enkel model antwoordt.
ChatGPT, Claude en Grok lagen donderdagmiddag ruim anderhalf uur tegelijk plat, blijkt uit de statuspagina's van OpenAI, Anthropic en xAI. Geen van de drie bedrijven heeft een oorzaak bekendgemaakt.
Dat maakt deze storing anders dan de vorige. De standaardafspraak voor uitval bij een AI-aanbieder is doorschakelen naar een tweede. Tussen 16.43 en 18.16 uur Nederlandse tijd stonden alle drie de aanbieders tegelijk als geraakt op hun eigen statuspagina. Wie in dat venster automatisch van OpenAI naar Anthropic of xAI uitweek, kwam bij een tweede foutmelding uit.
De tijdlijn volgens de drie statuspagina's
Anthropic ging als eerste onderuit. Om 14.37 uur opende het bedrijf een incident voor Claude Sonnet 5, dat binnen twintig minuten was verholpen. Om 15.26 uur volgde een tweede, veel bredere melding: verhoogde foutpercentages op Claude Mythos 5.1, Claude Fable 5.1, Opus 5, Opus 4.8 en Opus 4.6. De impact eindigde om 16.16 UTC, meldt Anthropic zelf, dus 18.16 uur hier.
xAI volgde vier minuten na die tweede melding. Om 15.30 uur ging Grok op iOS, Android, het web, Grok Build, de Office- en Workspace-plugins en Grok in X op storing, samen met de API-endpoints in us-east-1 en us-west-2. Het Europese endpoint eu-west-1 staat niet in die incidentlijst. Herstel volgde tussen 19.05 en 19.09 uur.
OpenAI kwam als laatste. Om 16.43 uur opende het bedrijf een incident over verhoogde foutpercentages in ChatGPT en Codex, met vijftien ChatGPT-componenten en vier Codex-componenten als geraakt. Om 17.17 uur was er een mitigatie, om 18.55 uur stond het incident op opgelost, met de kanttekening dat sommige Codex-gebruikers hun mobiele apparaat opnieuw moesten koppelen. Wat eruit lag was niet alleen de chatbox: gesprekken, inloggen, bestandsuploads, spraakmodus, zoeken, deep research en beeldgeneratie gaven allemaal fouten, tekende The Verge op.
Op Downdetector piekten de meldingen over OpenAI boven de 36.000. Ook programmeerassistent Cursor en Google Gemini kregen een piek te verwerken, al bevestigde Google geen storing.
Niemand noemt een oorzaak
Anthropic komt er het dichtst bij. Technisch medewerker CJ Avilla schreef dat een infrastructuurprobleem een gedeeltelijke storing veroorzaakte in Claude Code, de API en claude.ai. OpenAI en xAI zeiden niets over een oorzaak, en op vragen van The Verge reageerde geen van de drie bedrijven.
De voor de hand liggende verdachte is een gedeelde laag eronder. Axios wees op meldingen over Microsoft Azure, dat clouddiensten levert aan alle drie. Microsofts eigen Azure-statusoverzicht toonde donderdagavond geen enkele actieve storing en bevat ook geen incident voor 3 september. Cloudflare, dat op Downdetector eveneens meldingen binnenkreeg, ontkende ronduit: "Cloudflare is not experiencing any significant service disruptions at this time. Our services are operating normally, and any reporting that deviates from this is incorrect." PCMag tekende daarbij aan dat de uitval buiten de AI-sector geen bedrijven leek te raken.
Er ligt dus geen bewijs voor een gedeelde oorzaak. Er ligt ook geen bewijs tegen. Voor wie de AI-laag in het eigen product heeft zitten is dat de vervelendste uitkomst: je kunt geen enkele leverancier aanwijzen als de zwakke schakel, en dus ook niet om die schakel heen ontwerpen.
Een tweede aanbieder is geen terugvaloptie
Daarmee verschuift de vraag die je aan je eigen inrichting stelt. Niet: welke tweede aanbieder zet je ernaast. Maar: wat doet je proces als er helemaal geen model antwoordt.
Concreet is dat een degradatiestand. Verzoeken die niet verwerkt kunnen worden gaan in een wachtrij en worden afgehandeld zodra de dienst terug is. Een chatbot die geen antwoord krijgt verbindt door naar een mens in plaats van een technische fout te tonen. Een documentverwerker die niets kan uitlezen legt het document op een stapel voor handmatige controle en meldt dat aan de gebruiker. Geen van die drie vraagt om een tweede leverancierscontract.
Wat het wel vraagt is dat je weet welke stappen in je proces op een model leunen. Die afhankelijkheid ontstaat zelden bewust, ze groeit uit losse, op zichzelf verstandige besluiten die samen een web van afhankelijkheden vormen.
Van solostoring naar sectorstoring
De vorige twee incidenten bij OpenAI waren afgebakend. Op 25 juli merkte het bedrijf bij een wereldwijde storing 31 componenten aan als geraakt over ChatGPT, de API en Codex. Op 20 augustus lag inloggen op ChatGPT 52 minuten plat terwijl de API doordraaide. In beide gevallen was uitwijken naar een andere aanbieder in theorie een oplossing.
Donderdag was dat het niet. Drie bedrijven die elkaars concurrenten zijn, met eigen modellen en eigen datacentercontracten, gingen binnen twee uur van elkaar onderuit, zonder dat iemand kan zeggen waarom. Zolang die verklaring uitblijft is de beschikbaarheid van AI geen leveranciersvraag meer maar een ontwerpvraag: wat blijft er van je proces over op het moment dat geen enkel model antwoord geeft.
Veelgestelde vragen
Doorwerken als AI wegvalt
Een AI-stap in je proces is pas af als vaststaat wat er gebeurt zodra geen enkel model antwoordt. Ik denk mee over dat ontwerp, bouw de koppelingen en de terugvalstand en automatiseer de rest, zelf gehost waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
