Perplexity Research 发布了一项后训练研究,利用真实用户会话(包括失败会话)训练其 Computer 中的模型,方法结合了拒绝采样微调与提示引导的自蒸馏。核心创新在于不再仅凭结果筛选数据:成功会话中的非错误轮次用于模仿学习,而任何会话中带有验证提示的错误轮次则通过 KL 散度进行纠正,其余轮次仅保留为上下文。在线上 A/B 测试中,两个训练检查点之间的工具调用失败率从 2.24% 降至 1.77%,相对下降 21.2%,具有统计显著性。该研究的意义在于提出了一种更精细的训练信号分配方式,避免因模仿包含隐性错误的成功轨迹而强化错误,同时充分利用失败会话中的可纠正信息。不过,后训练权重与训练代码尚未开源,模型仅作为 Perplexity Computer 内的选项提供,基础模型 GLM 5.2 已在 Hugging Face 公开。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅