该研究针对智能体式大语言模型工作流的调度问题提出改进方案。这类工作流由模型推理轮次与工具调用交替组成,其端到端完成时间不仅取决于推理速度,还受制于就绪轮次何时被释放。现有运行时通常在轮次就绪后立即释放,但在资源竞争下,这种急切释放策略会积压大量已释放却未完成的工作,且一旦提交便无法再被工作流级策略重排,从而加剧尾部延迟。为此,作者提出一种尾部风险感知的轮次释放调度方法,联合决定下一个释放哪个就绪轮次以及维持多少已释放未完成的工作量。该方法采用均值—条件风险价值(CVaR)目标刻画未完成工作流的动态尾部风险,结合轮次工作量的在线估计进行优先级排序,并根据观测到的队列压力自适应调整释放预算。基于软件工程任务的真实智能体执行轨迹,在多种模型和工作流到达率下评估,结果显示该方法在轻负载下与急切释放性能相当,在竞争条件下显著降低工作流流时间的P95,最高实现3.50倍加速。
| Agentic LLM Workflows | 由大语言模型驱动的智能体工作流,包含模型推理轮次与工具调用的交替序列。 |
| Tail-Aware Scheduling | 关注尾部延迟(如P95)的调度策略,旨在优化最慢的那部分请求的完成时间。 |
| Conditional Value-at-Risk (CVaR) | 条件风险价值,一种衡量尾部风险的指标,表示超过风险价值阈值的平均损失。 |
| Eager Release | 急切释放策略,即轮次一旦就绪就立即释放到执行队列中。 |
| Workflow Flow Time | 工作流流时间,指工作流从到达系统到完成所经历的总时间。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅