Uber 推出 ServiceScale 控制器,将扩缩容意图与执行操作解耦,使多个编排器能够安全协同管理同一组 Kubernetes 工作负载。其容器平台管理着 100 多个集群、约 4000 个服务和 300 万核 CPU,每天启动 150 万个 Pod。此前区域故障转移依赖静态预留容量,新方案改为复用低优先级工作负载资源,通过优先级抢占实现故障时的容量再分配,将稳态配置从 2 倍降至 1.3 倍,节省超 100 万 CPU 核。团队引入 ServiceScale 自定义资源定义和服务扩缩容控制器,让各编排器声明意图并统一调和,避免扩展核心控制器带来的回归风险。文章还分享了过期 Informer 缓存和多写入者并发等生产经验,整个方案历时一年上线,未造成用户可感知中断。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅