🔥 今日值得一读 端侧大模型连续查询就崩溃?热感知RL路由器让手机GPU稳了
HybridInfer: Thermal-Aware Reinforcement-Learning Tier Routing for On-Device, Edge, and Cloud LLM Inference
arXiv LG (cs.LG) 🔥 重点 #推理优化#端侧推理#强化学习 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
移动端LLM应用可借此动态选择推理层级,避免连续查询导致GPU崩溃,兼顾隐私与成本。

📖 AI 总结

本文提出 HybridInfer,一种面向端侧、边缘与云端三层大模型推理架构的热感知强化学习路由器。作者在骁龙旗舰设备上发现,端侧持续生成不仅导致降速,还会使 GPU 推理运行时在连续数次查询后崩溃或静默卡死,问题源于 OpenCL 内核编译与长提示预填充,且与设备温度无关,长文本生成时尤为严重。HybridInfer 以手机热余量和查询复杂度估计为状态,通过离线训练的 Q 学习策略在三层模型间选择执行层级,奖励函数在质量、延迟、成本与热惩罚之间权衡,并加入本地性奖励以鼓励端侧执行,作者证明该奖励是热感知路由成立的前提。在 210 条真实 Android 提示基准上,学习到的路由器质量显著优于两种手工调优启发式(p<0.02),且自适应方案中成本最低。该工作首次在真实硬件上利用端侧热余量进行多层级推理调度。

🔑 关键词速览

HybridInfer一种热感知强化学习路由器,用于在端侧、边缘和云端三层级之间动态选择LLM推理层级。
热余量(Thermal Headroom)设备当前温度与热限制之间的余量,用于衡量设备还能承受多少计算负载而不触发过热降频。
Q学习(Q-learning)一种离线强化学习算法,通过估计状态-动作值函数来学习最优策略。
本地性奖励(Locality Bonus)奖励函数中鼓励在端侧执行推理的额外奖励项,以促进数据本地化和降低延迟。
多层级路由(Tier Routing)根据查询特征和系统状态,在端侧、边缘和云端等不同计算层级之间分配推理任务。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅