🔥 今日值得一读 智能体跨环境学习新突破:RISE让失败与成功轨迹也能高效训练
RISED: Rubrics for Agentic Multi-Environment Selection and Self-Distillation
Apple ML Research 🔥 重点 Agent论文方法大模型 🕐 10-06 08:00

📖 AI 总结

苹果研究团队提出RISED方法,旨在解决单一LLM智能体跨多环境联合训练中的两个核心难题:现有课程与数据选择策略多停留在环境层面或依赖局部奖励信号,忽视了不同环境间rollout的关联;同时各环境学习进度不一,批次内会同时出现全失败与全成功的rollout组,导致这些数据缺乏组内相对奖励信号。为此,RISED将评分细则(rubrics)从单纯的奖励来源扩展为三重用途:由LLM评判器依据跨环境共享的细则词表为每个rollout打标签,其行为画像用于筛选与混合环境批次整体行为构成相符、且与已选数据重叠有限的数据;正向细则为在线自蒸馏教师提供特权上下文,补充token级监督;负向细则则引导后续rollout生成远离反复出现的失败模式。实验表明,在多种模型骨干上,RISED取得跨环境最高平均通过率,并在每个单独环境中位列第一或第二,基于细则的分析还能刻画伴随性能提升的行为变化。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅