万亿参数模型内部竟藏科学判断控制面,元认知引导让自主系统挖出8个真实漏洞还造出火箭!
Metacognitive Steering: Learning the Structure of Scientific Judgment
arXiv AI (cs.AI) 重要 论文方法Agent大模型 🕐 09-16 12:00

📖 AI 总结

该研究探讨了能否从科学家的交互轨迹中提取"科学判断"这一过程性能力,并用于控制冻结的前沿模型内部计算。作者通过对真实科研过程中的对比干预数据进行分析,在万亿参数混合专家模型Kimi 2.6中发现了一个协调的低维控制结构,残差分析、注意力权重子空间对齐与跨层奇异值分解均收敛于一个中层控制面。基于此,研究者提出"元认知引导"方法,一种推理时控制器,能够读取模型的认知状态并动态组合针对探索、程序收敛与批判性重评估的层级干预,且无需修改模型参数。行为分析显示,该控制机制能带来更持续的探索、显式的剪枝和证据响应式综合。该方法在自主研究系统Columbus-1中得到验证,该系统在BlueZ中发现了八个可独立复现且攻击者可利用的漏洞,并指导了使用不可节流固体发动机实现推进着陆的十英尺火箭的设计、仿真与制造。研究意义在于,过程层面的科学判断可为模型推理策略提供可解释的动态控制监督。

🔑 关键词速览

Metacognitive Steering一种推理时控制方法,通过读取模型认知状态并动态组合层特定干预来引导推理策略,而不修改模型参数。
Kimi 2.6一个万亿参数的混合专家(MoE)大型语言模型,作为本文控制方法的研究对象。
Mixture-of-Experts (MoE)一种模型架构,其中多个专家子网络被稀疏激活,以提升参数效率和计算效率。
Cross-layer Singular Value Decomposition (SVD)一种分析技术,通过奇异值分解识别跨模型层的低维控制子空间。
Columbus-1一个自主研究系统,应用元认知引导方法,在漏洞发现和火箭设计等任务中展示科学判断能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅