开源模型性能建模全军覆没?GPT-5.6通过率超80%碾压82.4%
PerfReasoning: How Well Do LLMs Reason on Hardware Performance?
arXiv AI (cs.AI) 重要 大模型硬件评测 🕐 09-07 12:00

📖 AI 总结

该研究提出了PerfReasoning基准,用于评估大语言模型在硬件性能建模中的推理能力,涵盖直接性能推理和生成分析性性能模型代码两个层面。测试要求模型根据工作负载、架构和映射规格比较不同映射方案,并预测片外流量和缓冲区需求。结果显示,最强闭源模型在推理问答中准确率超过90%,最佳开源模型达到82.4%;但模型构建任务难度显著更高,除GPT-5.6 Sol通过率超80%外,其余模型配置平均低于15%且运行间波动明显。任务特定强化学习可将4B模型的映射推理准确率提升15.7个百分点,而无反馈的多轮自我修订提示效果不稳定。该基准揭示了LLM在架构推理合理性与可靠性能模型构建之间的明显差距,其公开发布将支持可复现评估并追踪领域进展。

🔑 关键词速览

PerfReasoning一个用于评估LLM在硬件性能推理和性能模型代码生成能力的基准测试。
LLM大型语言模型,如GPT系列,用于处理自然语言和生成文本。
performance modeling性能建模,指通过数学或计算模型预测硬件或软件系统的性能。
off-chip traffic片外流量,指芯片与外部存储器之间的数据传输量。
mapping映射,指将计算任务分配到硬件资源(如处理单元和存储器)的方式。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅