GitHub 于 8 月 17 日发生大规模宕机,官方复盘显示根因在于负载均衡器配置错误。该错误导致后端服务健康检查失效,进而引发流量分配异常,最终触发系统性的重试风暴。大量客户端在短时间内反复请求,导致后端资源被迅速耗尽,服务进入级联故障状态。此次事件持续数小时,影响了全球范围内的代码托管、CI/CD 及协作功能。GitHub 团队通过紧急回滚配置、扩容关键服务并实施流量限制才逐步恢复。复盘报告强调,配置变更缺乏充分的灰度验证和自动化防护是主因,并计划引入更严格的变更审查机制与故障演练。该事件凸显了大型分布式系统中配置管理的高风险性,以及重试机制设计不当可能放大故障的严重性。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅