本文提出 HybridInfer,一种面向端侧、边缘与云端三层大模型推理架构的热感知强化学习路由器。作者在骁龙旗舰设备上发现,端侧持续生成不仅导致降速,还会使 GPU 推理运行时在连续数次查询后崩溃或静默卡死,问题源于 OpenCL 内核编译与长提示预填充,且与设备温度无关,长文本生成时尤为严重。HybridInfer 以手机热余量和查询复杂度估计为状态,通过离线训练的 Q 学习策略在三层模型间选择执行层级,奖励函数在质量、延迟、成本与热惩罚之间权衡,并加入本地性奖励以鼓励端侧执行,作者证明该奖励是热感知路由成立的前提。在 210 条真实 Android 提示基准上,学习到的路由器质量显著优于两种手工调优启发式(p<0.02),且自适应方案中成本最低。该工作首次在真实硬件上利用端侧热余量进行多层级推理调度。
| HybridInfer | 一种热感知强化学习路由器,用于在端侧、边缘和云端三层级之间动态选择LLM推理层级。 |
| 热余量(Thermal Headroom) | 设备当前温度与热限制之间的余量,用于衡量设备还能承受多少计算负载而不触发过热降频。 |
| Q学习(Q-learning) | 一种离线强化学习算法,通过估计状态-动作值函数来学习最优策略。 |
| 本地性奖励(Locality Bonus) | 奖励函数中鼓励在端侧执行推理的额外奖励项,以促进数据本地化和降低延迟。 |
| 多层级路由(Tier Routing) | 根据查询特征和系统状态,在端侧、边缘和云端等不同计算层级之间分配推理任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅