手机端大模型提示词越费脑越耗电?实测发现:认知负荷直击每token能耗,措辞模式左右token用量!
How Do Prompt Variations Affect Energy Consumption in On-Device LLMs?
arXiv CL (cs.CL) 重要 #端侧部署#能耗优化#提示工程 🕐 09-03 12:00

📖 AI 总结

该研究探讨了在移动设备上部署大型语言模型时,提示词设计对能源消耗的影响,这是一个此前未被充分研究的领域。研究通过广泛的实证分析,考察了提示词的两个属性——认知负荷和措辞模式——如何影响设备端LLM推理的能耗,并采用阶段级剖析方法区分预填充和解码阶段的能量消耗。关键发现是:认知负荷主要影响每令牌的能量成本,而措辞模式则主要通过影响令牌使用量来改变能耗。此外,能量-质量分析表明,提示词设计在不同模型上重塑了可实现的性能边界,凸显了在能效优化的设备端LLM推理中,需要针对具体模型进行提示词设计的重要性。该研究为移动端AI应用的能效优化提供了实证依据和设计指导。

🔑 关键词速览

On-device LLMs在移动设备上运行的大型语言模型,强调本地推理而非云端处理。
Cognitive load提示对用户或模型认知资源的需求程度,可能影响推理的能源消耗。
Phrasing pattern提示的措辞结构或表达方式,如提问形式或陈述形式。
Prefill and decode energyLLM推理的两个阶段:预填充(处理输入提示)和解码(生成输出),分别测量的能源消耗。
Energy-quality analysis评估提示设计在能源消耗与输出质量之间的权衡,以优化部署。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅