该研究探讨了在移动设备上部署大型语言模型时,提示词设计对能源消耗的影响,这是一个此前未被充分研究的领域。研究通过广泛的实证分析,考察了提示词的两个属性——认知负荷和措辞模式——如何影响设备端LLM推理的能耗,并采用阶段级剖析方法区分预填充和解码阶段的能量消耗。关键发现是:认知负荷主要影响每令牌的能量成本,而措辞模式则主要通过影响令牌使用量来改变能耗。此外,能量-质量分析表明,提示词设计在不同模型上重塑了可实现的性能边界,凸显了在能效优化的设备端LLM推理中,需要针对具体模型进行提示词设计的重要性。该研究为移动端AI应用的能效优化提供了实证依据和设计指导。
| On-device LLMs | 在移动设备上运行的大型语言模型,强调本地推理而非云端处理。 |
| Cognitive load | 提示对用户或模型认知资源的需求程度,可能影响推理的能源消耗。 |
| Phrasing pattern | 提示的措辞结构或表达方式,如提问形式或陈述形式。 |
| Prefill and decode energy | LLM推理的两个阶段:预填充(处理输入提示)和解码(生成输出),分别测量的能源消耗。 |
| Energy-quality analysis | 评估提示设计在能源消耗与输出质量之间的权衡,以优化部署。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅