🔥 今日值得一读 教师模型57%失败?新方法专治“生成即丢弃”,把失败变信号,蒸馏效率翻倍!
PROOF-Gen: From Optimized Data to Better Distillation
Apple ML Research 🔥 重点 论文方法Agent数据优化 🕐 08-26 08:00

📖 AI 总结

PROOF-Gen 提出了一种从失败轨迹中恢复高质量训练数据的方法,以提升工具调用模型的蒸馏效果。传统流程依赖教师模型生成并通过过滤保留成功轨迹,但在 τ²-bench 基准上57%的教师尝试失败,其中三分之二为仅因单个关键错误而失败的近失案例,这些失败数据被直接丢弃。PROOF-Gen 通过逐场景提示优化,让反射器分析执行轨迹和评估反馈,生成纠正性指导以引导教师产出成功轨迹,训练时再剥离这些指导,使学生仅从干净演示中学习。实验显示该方法恢复了93%的失败场景,Qwen3-4B 的 Pass@1 从0.132提升至0.529,Gemma 4 E4B 在 BFCL v4 多轮任务上提升7.2个百分点。部署环境中,目标完成率提升6.3个百分点,并正向迁移至端侧模型,非英语场景平均提升1.48个百分点,验证了其跨场景有效性。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅