Risikoregister · Eintrag
Q3 · KonstruiertAWS-US-EAST-1-Ausfall
Eine routinemäßige Skalierungsaktion traf einen latenten Fehler und legte das halbe Internet lahm.
Eng gekoppelte Systeme, in denen ein kleiner Fehler kaskadiert und die ganze Maschine zum Stillstand bringt.
Warum dieser Quadrant
Der Auslöser war eine eng umrissene, konstruierte Auszahlungsstruktur (ein interner Automatisierungsfehler mit einem erkennbaren, eingrenzbaren Fehlermodus), doch das Tail-Verhalten wurde in dem Moment fett und korreliert, als es die gemeinsam genutzte Infrastruktur berührte. So erzeugte ein Softwarefehler in einer einzigen Region gleichzeitige, nicht versicherte Verluste in nicht miteinander verbundenen Branchen weltweit.
Die Aktenlage
- Der Ausfall begann um 7:30 Uhr PST / 10:30 Uhr ET, 7. Dezember 2021gesichert
- Die interne Migration des DNS-Verkehrs wurde um 9:28 Uhr PST abgeschlossen, womit die DNS-Fehler behoben warengesichert
- Die meisten Kerndienste (EC2-API-Fehler, Instanzstarts) erholten sich zwischen 1:15 und 2:40 Uhr nachmittags PSTgesichert
- Vollständige Behebung (Amazon Connect, EventBridge) erst zwischen 4:41 und 6:40 Uhr nachmittags PST, insgesamt rund 7-9 Stunden je nach Dienstgesichert
- Zu den betroffenen Unternehmen zählen Netflix, Disney+, Coinbase, Ring, der Einzelhandels- und Lagerbetrieb von Amazon, Roomba und Ticketmastergesichert
- Anmeldungen bei Amazon Flex und den Dolphin-Scannern schlugen in Lagern in mindestens 14 namentlich genannten US-Bundesstaaten sowie in Ontario, Kanada, fehlwahrscheinlich
- Eine zweite Störung in US-EAST-1 folgte am 10. Dezember 2021wahrscheinlich
- Keine offiziell von AWS veröffentlichte Kostenschätzung in Dollar speziell für das Ereignis im Dezember 2021 (anders als beim deutlich größeren, gesondert dokumentierten AWS-Ausfall im Oktober 2025)unsicher
Quellen
Der Newsletter
Jede Woche eine Risikogeschichte, auseinandergenommen wie diese: was bekannt war, was ignoriert wurde, und in welchem Quadranten sie wirklich lag.
Kein Spam, eine E-Mail pro Woche.