风险登记册 · 条目
Q3 · 工程化AWS US-EAST-1 宕机
一次常规的扩容操作触发潜藏的漏洞,让半个互联网瘫痪。
紧密耦合的系统:一个小故障层层传导,最终让整台机器停摆。
为什么是这个象限
触发因素是一个狭窄的、工程化的收益结构(一个内部自动化缺陷,其故障模式可知、可控),但它一接触到共享基础设施,尾部行为就变肥并高度相关,于是一个单区域的软件缺陷在全球互不相关的行业中同时造成了没有保险覆盖的损失。
记录在案
- 故障始于 2021 年 12 月 7 日太平洋标准时间上午 7:30 / 东部时间上午 10:30确定
- 内部 DNS 流量迁移于太平洋标准时间上午 9:28 完成,DNS 错误随之解决确定
- 大部分核心服务(EC2 API 错误、实例启动)在太平洋标准时间下午 1:15 至 2:40 之间恢复确定
- 完全恢复(Amazon Connect、EventBridge)要到太平洋标准时间下午 4:41 至 6:40,视服务不同总计约 7-9 小时确定
- 受影响的公司包括 Netflix、Disney+、Coinbase、Ring、亚马逊零售/仓储业务、Roomba、Ticketmaster确定
- Amazon Flex 和 Dolphin 扫描枪的登录在美国至少 14 个具名州以及加拿大安大略省的仓库中失败很可能
- 2021 年 12 月 10 日 US-EAST-1 又发生了第二次中断很可能
- AWS 未针对 2021 年 12 月这次事件公布任何官方的美元损失估算(不同于规模大得多、另有记录的 2025 年 10 月 AWS 故障)不确定
来源
通讯
每周一则风险故事,像这一则一样被拆开:什么是已知的,什么被忽视了,以及它真正属于哪个象限。
不发垃圾邮件,每周一封。