语言生成研究目前主要围绕自回归解码、离散掩码扩散和连续流匹配三种范式展开,但由于各自依赖独立的代码库,跨范式的比较往往受实现细节干扰,难以反映范式本身的差异。针对这一问题,作者提出DantinoX——一个基于JAX/Flax的开源库,用单一模块化Transformer骨干同时支持上述三种范式。切换生成范式、注意力机制或硬件拓扑仅需修改配置,而骨干架构、分词器、初始化策略和训练基础设施保持一致,从而在同一套API内实现受控的跨范式对比,覆盖训练、流式推理与基准测试。该框架的意义在于为多范式语言建模提供了统一、可复现的实验平台,有助于更公平地评估不同生成范式的真实优劣。
| 自回归解码 | 一种按顺序逐个生成 token 的语言生成范式,每个 token 依赖于之前生成的 token。 |
| 离散掩码扩散 | 一种在离散 token 空间上通过逐步去掩码来生成文本的扩散模型范式。 |
| 连续流匹配 | 一种基于连续概率流常微分方程的生成范式,通过匹配向量场来建模数据分布。 |
| JAX/Flax | JAX 是谷歌开发的高性能数值计算库,Flax 是基于 JAX 的神经网络库,用于构建和训练模型。 |
| 模块化 Transformer 主干 | 一种可灵活配置的 Transformer 基础架构,支持不同范式、注意力机制和硬件拓扑的切换。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅