LLM生成芯片验证断言,改个写法就崩?最高27%正确结果翻车!
Robustness of LLM-Generated SystemVerilog Assertions to Semantics-Preserving RTL Transformations
arXiv LG (cs.LG) 重要 #LLM#硬件验证#鲁棒性 🕐 09-09 12:00

📖 AI 总结

该研究针对大语言模型(LLM)生成SystemVerilog断言(SVA)的可靠性展开评估,指出传统评测仅关注单一语法表示下的正确率,无法反映模型在等价RTL行为不同写法下的稳定性。作者基于VERT数据集构建了质量过滤的测试集,包含40个程序、295个赋值行为,并采用两种开源代码模型(Qwen2.5-Coder-7B和DeepSeek-Coder-V2-Lite)进行对照实验。研究考察了操作数重排、标识符重命名和冗余括号化三种语义保持变换,并引入条件鲁棒性、不变性失败率等指标。结果显示,在所有模型与变换组合中,9.7%至27.0%原本正确的行为在变换后出错;例如DeepSeek-Coder-V2-Lite在标识符重命名下整体准确率从53.9%升至63.7%,但19.5%的原始正确行为失效。人工审查发现错误类型包括路径谓词丢失、分支极性错误等。研究强调,仅凭点准确率不足以衡量LLM在硬件验证中的可靠性,需采用鲁棒性感知的评估方法。

🔑 关键词速览

SystemVerilog Assertion (SVA)SystemVerilog断言,一种用于硬件验证的形式化语言,用于指定设计应满足的时序和逻辑属性。
Metamorphic evaluation变形评估,一种测试方法,通过应用语义保持的变换来检查模型输出的一致性。
Semantics-preserving RTL transformations语义保持的RTL变换,指不改变硬件行为但改变代码语法表示的转换,如重命名或重排。
Conditional robustness条件鲁棒性,衡量在特定变换条件下,模型对原始正确行为的保持能力。
Any-flip rate任意翻转率,指在变换后,原本正确的行为变为错误的概率或比例。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅