Meta FAIR与牛津大学、伦敦大学学院的研究团队提出了AI研究偏好模型(RPMs),旨在解决机器学习实验中“想法生成廉价、验证昂贵”的瓶颈。RPM的核心功能是在GPU训练前对未执行的实验候选进行排序,仅挑选最优者运行,而非预测绝对分数——研究发现语言模型在预测指标或执行结果上并不可靠。该系统基于冻结的预训练大语言模型,无需微调,配套的AIRA-dojo框架和AIRS-Bench基准已开源,骨干模型Qwen3.6-27B为开放权重。在代理循环中,RPM通过并行生成15个候选并进行淘汰赛式两两比较,仅执行胜出者,从而大幅节省计算资源。研究提出两种变体:推理型RPM(离线准确率57.7%-59.0%)和代理型RPM(含沙盒环境,可运行小规模试点实验),为AI科研自动化提供了高效的计算分配策略。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅