🔥 今日值得一读 LLM同声传译新框架:延迟直降38.8%,BLEU反升1.2!
All In Good Time: Causality-Aware Framework for LLM-Based Simultaneous Speech-to-Speech Translation
arXiv CL (cs.CL) 🔥 重点 #语音翻译#同声传译#因果建模 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
做实时语音翻译的开发者可借鉴其因果对齐数据管线与自适应策略,降低延迟并提升跨语言音色保真度。

📖 AI 总结

该研究针对大语言模型在同步语音到语音翻译(Simul-S2ST)中面临的两大瓶颈——因果对齐训练数据稀缺、跨语言说话人保真度不足,以及现有方法依赖固定翻译策略或置信度启发式导致质量与延迟难以兼顾——提出了一个因果感知框架。其核心贡献包括:一套能生成高保真、因果对齐语音片段的新数据流水线,一种因子化S2ST架构(FAST),一个因果感知自适应策略(CAP),以及一个因果感知延迟度量指标。在CVSS西班牙语、德语和法语数据集上的实验表明,FAST-CAP持续改善质量与延迟的权衡关系,相比固定策略最高提升1.2 BLEU并实现26%的相对延迟降低;尽管训练数据量远少于现有系统,仍在翻译质量和说话人保真度上达到当前最优水平,延迟相对降低最高达38.8%。该工作为LLM驱动的同步语音翻译提供了兼顾质量、延迟与说话人一致性的可行路径。

🔑 关键词速览

Simul-S2ST同声语音到语音翻译,指在说话人尚未说完时即开始实时翻译并输出目标语音的任务。
因果对齐训练数据中源语音片段与目标翻译片段在时间上严格对应,且翻译仅依赖已出现的源内容,不泄露未来信息。
FAST因子化语音到语音翻译架构,将翻译过程分解为多个可独立处理的模块以提升效率与质量。
CAP因果感知自适应策略,根据当前已接收的源语音内容动态调整翻译决策,以平衡质量与延迟。
BLEU双语评估替补分数,一种常用的机器翻译质量自动评价指标,通过比较系统输出与参考译文的 n-gram 重叠度计算得分。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅