多智能体代码评判78%比较都猜错,准确率仅4.4%,无标签门控直接拒答,准确率翻倍到36.9%!
When Is a Multi-Agent Code Judge Actually Grounded? Two Label-Free Measurements, and a Judge That Declines to Guess
arXiv AI (cs.AI) 重要 Agent评测基准论文方法 🕐 今天 12:00

📖 AI 总结

这篇论文研究语言模型评判代码正确性时的可靠性问题。作者指出,多智能体验证方法依赖证据的两个条件:证据须独立于被审查的答案,且须能在两个候选方案之间产生区分。检索文档天然满足第二点,但在代码评判场景中这一条件不再成立。研究者在两个代码评判基准上对已发表的MARCH框架进行80组条件测量,发现该框架在78%至95%的比较中判定两个方案同样好,准确率仅为4.4%,而同一模型直接作答可达43.7%;降低题目难度或增大评判模型均无法改善。作者从流程自身日志中提取两项无需标签的测量指标来解释这一现象,并以其中一项作为门控,使流程在放弃无法判断的比较后,准确率从20.7%提升至36.9%,同时仍能回答约一半的比较。该工作的贡献不在于更准确的评判器,而在于提供一种无标签的方法,用以识别评判器何时缺乏作答依据。

🔑 关键词速览

多智能体验证 (Multi-agent verification)将复杂判断分解为多个可核查的子声明,并由多个智能体分别验证的方法。
MARCH一个已发表的代码评判框架,通过分解判断并验证证据来评估代码正确性。
无标签测量 (Label-free measurements)不需要人工标注的真实标签,仅从模型自身日志或输出中提取的指标。
门控 (Gating)根据某种信号决定是否执行某个操作,此处指拒绝无法可靠判断的比较。
代码评判基准 (Code judging benchmarks)用于评估模型判断代码正确性能力的标准测试数据集。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅