这篇论文提出了“启示控制”(Revelation Control)问题,即如何选择有代价的干预措施,仅揭示那些足以改变关键决策的隐藏状态,同时将干预本身产生的有用进展单独核算。作者为学习系统建立了理论框架,定义了决策充分启示与启示深度,区分纯信息价值与生产性复用,并将静态贝叶斯细化嵌入状态依赖的延续价值中。核心成果是一个精确的成本调整因子分解准则:仅当共享标量摘要的状态位于定价的停止/继续边界两侧时,额外的浅层坐标才具有决策非冗余性。实验基于Qwen2.5-7B和Mistral-7B-v0.3,发现更深层的未来学习探针具有正向决策价值,生产性复用带来严格的计算效用优势。研究支持结构性而非数值性迁移:决策理论、成本核算、延续逻辑和评估协议可跨系统迁移,而经验代理、系数、阈值乃至所需浅层状态维度可能因系统而异。
| Revelation Control | 一种决策问题,通过有代价的干预仅揭示能改变关键决策的隐藏状态,同时单独核算干预本身的进展。 |
| Decision-sufficient revelation | 一种揭示条件,要求揭示的信息足以支持当前决策,但不包含多余信息。 |
| Productive reuse | 指干预产生的信息或状态被重新用于未来学习或决策,从而带来额外效用。 |
| Stop/Continue boundary | 决策边界,区分停止或继续行动,用于判断状态是否决策非冗余。 |
| Familywise-adjusted lower bounds | 统计中控制族系错误率后得到的置信下界,用于多假设检验中的稳健性评估。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅