Uber把K8s扩容决策和执行拆开了,集群弹性更稳更抗压!
Uber 在 Kubernetes 平台上将扩容意图与执行操作解耦
InfoQ 中文 重要 算力工程架构 🕐 今天 23:00

📖 AI 总结

Uber 推出 ServiceScale 控制器,将扩缩容意图与执行操作解耦,使多个编排器能够安全协同管理同一组 Kubernetes 工作负载。其容器平台管理着 100 多个集群、约 4000 个服务和 300 万核 CPU,每天启动 150 万个 Pod。此前区域故障转移依赖静态预留容量,新方案改为复用低优先级工作负载资源,通过优先级抢占实现故障时的容量再分配,将稳态配置从 2 倍降至 1.3 倍,节省超 100 万 CPU 核。团队引入 ServiceScale 自定义资源定义和服务扩缩容控制器,让各编排器声明意图并统一调和,避免扩展核心控制器带来的回归风险。文章还分享了过期 Informer 缓存和多写入者并发等生产经验,整个方案历时一年上线,未造成用户可感知中断。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅