本文提出 Reviser,一种具备修订能力的文本生成方法。传统非自回归与基于编辑的模型虽能插入或修改前文内容,却依赖反复的序列级计算。Reviser 采用仅解码器 Transformer,将生成过程建模为在可变画布上执行光标相对动作的序列:每一步仅预测一个动作 token,即插入、移动或停止,并以编辑历史而非最终文本顺序进行自回归。该设计在保持简单下一动作接口的同时,实现了真正的非单调生成。在续写基准的竞技场评测中,Reviser 显著优于 SEDD 与 MDLM;轨迹统计显示模型频繁执行向后移动与画布中部插入,而非简单模拟末尾追加式解码。在 100M 与 300M 规模下,其表现与同规模自回归基线相当,且在统一 FLOPs 约定下推理计算量明显低于多轮精修与扩散类基线。
| Reviser | 本文提出的仅解码器 Transformer 模型,通过光标相对动作在可变画布上生成文本,支持非单调修订。 |
| 光标相对动作 | 模型在每一步预测的操作,包括插入标记、移动光标位置或停止,以相对方式控制生成过程。 |
| 非单调生成 | 生成顺序不严格从左到右,允许在序列中间插入或回退修改先前内容。 |
| SEDD | 一种基于分数熵的离散扩散模型,作为非自回归文本生成的基线方法。 |
| MDLM | 掩码离散语言模型,一种通过掩码预测进行文本生成的扩散式基线方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅