冻结裁判让LLM智能体少放5到11倍垃圾因子,代价是等500个交易日!
Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors
arXiv AI (cs.AI) 重要 Agent论文方法商业化 🕐 09-24 12:00

📖 AI 总结

本文探讨语言模型智能体在量化因子研究中的角色分工,提出"受治理的自我演化"框架:智能体负责提出候选因子,而一个其无法干预的冻结统计裁判负责评判。裁判仅依据提交后揭示的市场结果,通过下注式检验对每个候选因子打分,从而在任何停止时间下均保持错误发现率保证。研究在合成世界、探针编写环境和沪深500十年滚动回测中,将脚本、赌博机与语言模型三类提出者与冻结裁判及三种故意泄漏的裁判交叉对比。关键发现是:评判者决定误纳数量,冻结裁判在脚本提出者下比泄漏裁判少纳入5至11倍的次阈值因子,且无任何提出者能弥合该差距;提出者决定产出,语言模型优于脚本、与赌博机持平,并具备后者缺乏的编写诊断探针能力。代价是时间:被纳入的真实因子平均需等待约500个交易日,认证组合的夏普比率因此落后于无门控组合。结论是评判应归属程序,提出与工具制造应归属智能体。

🔑 关键词速览

受治理的自我进化 (governed self-evolution)一种智能体自主提出候选方案、但由外部不可篡改的统计裁判进行评判的机制,确保探索过程受控。
任意时间有效裁判 (anytime-valid referee)一种统计检验程序,其错误发现保证在任意停止时间下均成立,不依赖于预先固定的样本量。
错误发现保证 (false-discovery guarantee)对错误拒绝原假设(即错误准入无效因子)的比例或概率所施加的统计控制。
滚动前向测试 (walk-forward)一种时序回测方法,用历史数据训练模型并在后续未见数据上测试,模拟真实投资中的动态更新。
夏普比率 (Sharpe ratio)衡量投资组合每单位风险所获得超额收益的指标,值越高表示风险调整后表现越好。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅