苹果研究团队提出RISED方法,旨在解决单一LLM智能体跨多环境联合训练中的两个核心难题:现有课程与数据选择策略多停留在环境层面或依赖局部奖励信号,忽视了不同环境间rollout的关联;同时各环境学习进度不一,批次内会同时出现全失败与全成功的rollout组,导致这些数据缺乏组内相对奖励信号。为此,RISED将评分细则(rubrics)从单纯的奖励来源扩展为三重用途:由LLM评判器依据跨环境共享的细则词表为每个rollout打标签,其行为画像用于筛选与混合环境批次整体行为构成相符、且与已选数据重叠有限的数据;正向细则为在线自蒸馏教师提供特权上下文,补充token级监督;负向细则则引导后续rollout生成远离反复出现的失败模式。实验表明,在多种模型骨干上,RISED取得跨环境最高平均通过率,并在每个单独环境中位列第一或第二,基于细则的分析还能刻画伴随性能提升的行为变化。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅