LLM流水线证据越烂结构越稳?720次实测揭穿可靠性假象!
Evidence-State Reliability Under Controlled Degradation: Parser-Validity Divergence in a Multi-Stage LLM Pipeline
arXiv CL (cs.CL) 重要 #评测基准#LLM管道#可靠性 🕐 08-25 12:00

📖 AI 总结

该研究提出并验证了“证据状态可靠性”(ESR)评估框架,用于衡量多阶段大语言模型流水线中中间证据的完整性、一致性及可用性,并将其与仅关注结构合规的解析器有效性区分开来。实验基于GLM-5.2模型,在60个净化案例上设置四种证据条件(干净、压缩有损、部分缺失、噪声冲突),通过决策、审计和升级三个阶段共执行713次有效调用。结果显示,在九组对比中,所有阶段成功率估计均为负值且置信区间低于零,而解析器有效性点估计均为正,表明结构合规与证据敏感的阶段成功之间存在方向性背离。此外,审计阶段对退化证据的检测率达1.0,但升级阶段的恢复率为0,说明检测与恢复能力可分离。该研究揭示了多阶段流水线中结构有效性与实际可靠性可能脱节的问题,但结论受限于特定模型配置、流水线设计及单次运行规模。

🔑 关键词速览

Evidence-State Reliability (ESR)一种评估框架,关注中间证据在完整性、基础性、一致性和可用性方面是否满足阶段功能需求。
Parser Validity衡量输出结构是否符合预定义格式或语法规范的有效性指标。
Multi-Stage LLM Pipeline由多个顺序处理阶段组成的大型语言模型工作流,每个阶段执行特定功能。
Degradation Conditions实验中模拟的证据质量下降情景,包括压缩有损、部分缺失和噪声冲突等。
Bootstrap Intervals通过重采样方法估计统计量置信区间,用于评估估计值的可靠性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅