语言模型混合预测新突破:能力门控让Brier分数从0.0771降至0.0732!
Competence-Gated Pooling of Language Models and Priors for Event Forecasting
arXiv AI (cs.AI) 重要 #预测#模型融合#不确定性 🕐 09-14 12:00

📖 AI 总结

本文研究混合事件预测中如何判断语言模型相对于已有外部预测(如市场、群体或统计预测)是否具有边际价值,而非仅关注模型自身的准确率。作者在Brier损失框架下刻画了模型分歧何时能改进外部预测,并推导出使用领域特定权重相对于全局权重的增益。为此提出一种"能力门控"机制,根据已解决结果估计领域级来源权重,将不确定估计向全局权重收缩,并对合并预测进行重新校准。在2357个已解决的二元问题和五个语言模型上,该门控将主要外部基线的Brier分数从0.0771降至0.0732,显著优于全局预测组合,且在泄漏控制和泄漏安全的时间序列先验下依然成立。但在ForecastBench官方市场子集上无显著提升,此时系统基本让位于市场。研究还发现,在四个Qwen模型上,语言表达的置信度无法可靠识别模型何时优于外部预测,而基于结果估计的能力则能支持更好的弃权决策。该工作为基于可测边际价值的选择性模型使用提供了实用方法。

🔑 关键词速览

Brier损失一种用于评估概率预测准确性的评分规则,计算预测概率与实际结果之间平方误差的均值。
能力门控一种机制,根据模型在特定领域相对于外部预测的估计边际价值,决定是否采纳该模型的预测。
相对能力模型在已有外部预测之外的边际价值,而非其独立准确率。
池化权重在组合多个预测源时,分配给每个源的权重,用于生成最终的综合预测。
泄漏控制在评估中采取措施防止未来信息泄露到预测过程中,以确保结果的可靠性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅