该技术报告提出NCP-ArchPreview,一种在标准下一词预测(NTP)之外引入下一概念预测(NCP)的潜空间语言模型。模型从隐藏状态构建乘积量化概念词表,通过专门的概念模块预测跨多个词元的离散概念,并将预测结果反馈至词元层面指导生成,NTP与NCP端到端联合训练。模型规模扩展至89亿参数,在Dolma-3数据集的5.73万亿词元上训练,是迄今最大规模的潜空间语言模型演示。关键发现是:仅消耗51.3%的训练词元即达到OLMo-3-7B的最终预训练损失,全量预训练后在下游宏平均上超出后者2.45分,GSM8K提升5.99分;仅用85%标准算力即接近参数对齐的89亿基线。该工作表明概念级潜空间目标可显著提升训练效率与下游性能,为语言模型预训练提供了新方向。
| Next Concept Prediction (NCP) | 下一概念预测,一种在词元级自回归之外引入概念级预测目标的预训练方法,用于预测跨越多个词元的离散概念。 |
| Latent Space Language Model | 潜在空间语言模型,在隐表示空间中进行建模和预测的语言模型,而非仅在离散词元空间操作。 |
| Product-Quantized Concept Vocabulary | 乘积量化概念词表,通过乘积量化技术从模型隐藏状态构建的离散概念集合,用于表示多词元概念。 |
| Concept Module | 概念模块,模型中专门用于根据潜在空间表示预测未来概念的组件。 |
| DFlash2 Drafter | DFlash2 草稿模型,一种用于推测解码的轻量级模型,通过注入概念表示可提高生成效率。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅