该技术报告介绍了Pistis多模态大语言模型系列,包含基于Qwen3.6构建的27B模型和基于Qwen3.5构建的9B模型,二者均通过一套通用且可扩展的后训练框架开发。该框架先以大规模多模态监督微调奠定基础,进而提出交错蒸馏与强化学习(IDRL)这一新型后训练范式,在单一训练循环中交替执行同策略蒸馏与强化学习,而非孤立优化或静态联合损失,从而实现更有效的知识迁移、更高的优化稳定性以及更精准的长程智能体轨迹信用分配,在提升性能的同时缓解常见的能力权衡问题。两种规模下均产出两个专用变体:Pistis-Thinking侧重深度多模态推理,Pistis-Agentic则引入智能体轨迹数据以支持长程规划、迭代推理与工具使用,在多模态搜索方面表现尤为突出,且均优于各自基座模型。此外,研究还提出系统级方法Pistis-Auto-Harnessing(PAH),通过迭代优化自动改进智能体的推理框架,在不更新模型参数、不增加交互预算的前提下提升模型性能。
| Pistis | 本文提出的多模态大语言模型系列,包含27B和9B两种参数规模。 |
| IDRL | 交错蒸馏与强化学习,一种在单训练循环中交替进行同策略蒸馏和强化学习的新型后训练范式。 |
| SFT | 监督微调,使用标注数据对预训练模型进行有监督训练以提升特定任务性能。 |
| Pistis-Agentic | Pistis模型的一个变体,整合智能体轨迹数据以支持长时程规划、迭代推理和工具使用。 |
| PAH | Pistis-Auto-Harnessing,一种系统级方法,通过迭代优化自动改进智能体的推理框架而不更新模型参数。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅