更多推理并非总是更好!预测智能体靠行为压力测试选对证据来源
When Should Forecasting Agents Reason? Behavioral Stress Tests for Reliability Routing
arXiv AI (cs.AI) 重要 #Agent#预测#可靠性路由 🕐 今天 12:00

📖 AI 总结

本文研究预测智能体在何时应信任何种行为机制,基于ForecastBench风格的二元预测任务,将检索、推理、参考市场先验或使用历史类比等选择视为可观测的智能体行为而非隐藏的实现细节。核心发现是机制选择依赖于证据来源:对某些数据生成过程,结构化历史类比占优;对其他过程,市场/群体式与保守基线更佳。作者提出ReliabilityRoute,一种利用历史覆盖率、市场先验可用性、来源先验锐度、证据强度、证据分歧和时间跨度等可靠性特征来引导预测智能体行为的结构性干预方法。基于2024年拟合的固定规则可接近人工分类效果,而滚动前向自适应规则在后续16个LLM版本上取得确定性系统中最优的平均Brier分数。研究强调增益有限,历史与搜索基线仍具竞争力,主要贡献在于行为压力测试表明更多推理并非总是更好,预测智能体应首先估计哪一证据来源值得主导,路由策略本身也应在可审计约束下自适应调整。

🔑 关键词速览

Forecasting Agents预测智能体,指结合语言模型推理、检索、集成和校准等技术进行预测的AI系统。
ReliabilityRoute可靠性路由,一种结构性干预方法,利用可靠性特征引导预测智能体的行为选择。
Brier Score布里尔分数,一种用于评估概率预测准确性的指标,值越小表示预测越准确。
Walk-forward Self-adjusting Rule前向自调整规则,一种根据历史数据动态调整阈值以适应新数据的策略。
Behavioral Stress Test行为压力测试,通过模拟不同条件来评估智能体行为可靠性的方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅