本文提出一种面向端到端同声传译的自监督前缀训练方法,使语音语言模型能够在源语音尚未结束时即输出目标文本,同时保证已提交内容不被修改。该方法利用模型自身对完整与部分波形生成的翻译结果构造前缀监督信号,无需转录文本或人工翻译。研究比较了单轮强制前缀与多轮仅追加两种解码方式,并通过置信度阈值控制推理阶段的质量与延迟权衡,同时考察训练前缀密度的影响。在FLEURS和CoVoST2三个翻译方向上,前缀训练显著改善了质量—延迟前沿,其中置信度策略提供了最稳定的可操作区间,多轮解码在低延迟场景下表现更优。多轮训练使提交校准误差整体下降63%至68%,早期前缀处下降68%至80%,而单轮训练校准改善有限。研究还发现,较小的合成边距有时可将前沿延伸至更低延迟,但边距过大会损害翻译质量与校准,合成密度与质量—延迟之间呈非单调关系。
| 同声传译 (Simultaneous Speech Translation) | 在说话人尚未说完时就开始翻译并输出目标语言文本的任务。 |
| 前缀监督 (Prefix Supervision) | 利用源语音的部分片段及其对应翻译来训练模型,使其学会在部分输入下生成输出。 |
| 仅追加解码 (Append-only Decoding) | 一种解码策略,模型只能向已生成的序列末尾添加新词元,不能修改已提交的内容。 |
| 质量-延迟权衡 (Quality-Latency Trade-off) | 在翻译质量与输出延迟之间进行取舍,通常延迟越低质量越差。 |
| 提交校准误差 (Commit-calibration Error) | 衡量模型在决定何时提交翻译片段时,其置信度与实际正确性之间偏差的指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅