🔥 今日值得一读 Sage把答案泄漏率从70.9%压到2.7%,语义保真度达73.3%!
Sage: Formalization with Semantic Correction
arXiv LG (cs.LG) 🔥 重点 #定理证明#形式化#Agent#语义校正 🕐 09-30 12:00
👨‍💼 主理人解读 · 为什么值得关注
把自然语言数学题转成Lean 4时,用它检测并修正丢假设、空真等类型检查器漏掉的问题。

📖 AI 总结

本文提出Sage(语义智能体引导的形式化引擎),旨在解决自然语言数学命题转化为Lean 4形式化语句时的"严谨性幻觉"问题——传统类型检查器会接受那些虽能编译但丢失假设、引入空洞真值或篡改数学边界的语句。Sage以四阶段分解生成流水线替代单体式翻译,并配合双信号语义校正循环,将Lean 4编译器诊断与多维语义反馈相结合,在保证语法有效的同时强制数学保真度。该框架明确区分开放式查询与声明式形式化目标之间的差距,从而抑制模型通过猜测未验证答案来虚高形式化率的行为:单体基线答案泄漏率高达70.9%,Sage将其压低至2.7%,并在无证明的Omni-MATH上实现73.3%的pass@4联合编译与语义保真度,显著优于微调后的Goedel-Formalizer-V2基线(42.0%)。在包含175道未形式化IMO题目的IMO-Unformalized基准上,Sage展现出有效的零样本泛化能力,pass@4验证保真度达87.4%,而基线仅为19.4%,并在超过79%的盲评成对比较中胜出。

🔑 关键词速览

Sage语义智能体引导的形式化引擎,一种将自然语言数学问题转化为 Lean 4 形式化陈述的智能体框架。
Lean 4一种交互式定理证明器,用于形式化数学陈述和证明,并提供编译诊断。
语义校正循环结合编译器诊断与多维语义反馈的迭代校正机制,确保形式化陈述既语法正确又数学忠实。
答案泄漏模型在形式化过程中直接猜测或嵌入未经验证的答案,导致形式化率虚高但实际无效的现象。
pass@4一种评估指标,表示在四次尝试中至少有一次成功通过编译和语义验证的比例。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅