ZGCM-1 是一个完全开源的 7B 稠密基础模型,从零训练,主打数据、系统与算法层面的极致效率。其核心思路是:紧凑模型无法被动记忆开放网络,但可通过内部思考与外部工具调用的结合突破参数容量限制。为此,研究团队开发了支持 256K 上下文的端到端高效训练方案,包括交错门控滑动窗口与全注意力架构、稳定的 FP8 Muon 优化器,以及覆盖 16K、64K、256K 的渐进式课程学习和将交互轨迹重构为马尔可夫决策过程的中间训练。团队还建立了由智能体集群自主管理集群运维、数据整理与快速诊断评估的 AI 原生研发流程。评估显示,该模型在通用基准上与同规模 7B 模型相当,在数学推理和智能体搜索任务上可与参数量大数个量级的前沿模型竞争,预训练设计在 16K 场景下带来约 4.2 倍的效率提升。研究还总结了八项可操作的经验发现,并开源了各阶段权重、检查点、训练代码、数据配方及日志。
| ZGCM-1 | 本文提出的一个完全开放的70亿参数稠密基础模型,专为数学推理和智能体搜索设计。 |
| FP8 Muon 优化器 | 一种使用8位浮点精度进行计算的稳定优化器,旨在提高训练效率和稳定性。 |
| MDP 中期训练 | 将交互轨迹重新表述为马尔可夫决策过程的中期训练阶段,以增强模型的决策能力。 |
| 智能体搜索 | 模型主动使用外部工具进行信息检索和推理的搜索范式,以扩展其能力。 |
| 256K 上下文 | 模型支持处理长达256,000个标记的上下文窗口,适用于长文档和复杂推理任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅