同传翻译卡顿?新方法让AI同传不闪烁,质量延迟双赢!
Dynamic Lagging for Simultaneous Translation
arXiv CL (cs.CL) 重要 #机器翻译#LLM#推理优化 🕐 09-09 12:00

📖 AI 总结

该研究提出了一种面向级联同声传译的动态延迟控制方法。核心思路是让仅经句子训练的 decoder-only LLM 具备前缀感知能力:通过在稳定前缀(即当前部分源文本与模型全句输出共享的最长前缀)与完整句对混合数据上微调,并采用单次强制解码回合,使已提交的目标文本随源文本增长而推进,从而从构造上消除系统闪烁。作者以 Qwen3-8B 进行英译德、日、中实验,用参考转录前缀模拟源流。结果显示,前缀微调在保持全句质量的同时提升了最差位置分块质量,并改善了 token 级提交置信度的校准,降低了早期源前缀的期望校准误差。在三种延迟控制机制中,基于该置信度的无训练阈值方法最为有效,能绘制出优于离散 wait-k 和目标后缀删除法的连续质量-延迟前沿,且在 FLEURS、WMT24++ 和 CoVoST 2 测试集上经 COMET 与 MetricX 评估均表现稳定。

🔑 关键词速览

cascaded simultaneous speech translation级联同声语音翻译,指将语音识别和机器翻译串联,边识别边翻译的实时翻译系统。
stable prefix稳定前缀,指当前部分源语言对应的所有可能翻译中,与完整源语言翻译共享的最长前缀,用于训练模型的前缀感知能力。
force-decode强制解码,一种推理方式,模型在已有目标前缀的基础上继续生成,而不是从头开始。
expected calibration error (ECE)期望校准误差,衡量模型预测置信度与实际正确率之间差距的指标,越低表示校准越好。
wait-k一种同步翻译策略,模型等待k个源语言词后开始翻译,k为固定延迟。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅