本文针对大语言模型在翻译含格式标签文本时难以兼顾译文流畅性与标签保真度的问题,提出了一套涵盖数据合成、能力构建和多目标对齐三个层面的系统性解决方案。在数据层面,作者指出合成数据中结构标签多样性与翻译自然度之间存在根本性权衡,并提出混合合成策略Hy-LST以同时兼顾两者;在能力层面,将标签感知翻译拆解为四个难度递增的子任务,通过多任务监督微调实现针对性能力获取与知识迁移;在对齐层面,基于组相对策略优化框架设计了三类互补奖励函数,分别对应流畅性、标签保真度和标签范围内的翻译质量,并验证联合优化优于单一奖励方案。在六个翻译方向上(en2zh、en2ja、en2de、en2fr、en2ru、de2fr)的实验表明,各层面均带来可量化提升,完整系统显著优于现有方法,定性分析还揭示了具体错误模式及其缓解效果。
| Hy-LST | 一种混合合成策略,结合基于LLM的合成标签方法和两阶段基于LLM的合成标签方法,用于生成多样且自然的带标签数据。 |
| 标签感知翻译 | 指在翻译过程中同时处理文本中的格式标签,确保标签的结构、语义和功能意义在译文中得以保留的翻译任务。 |
| 组相对策略优化 | 一种强化学习优化框架,通过比较一组策略的相对表现来优化目标,本文用于多目标对齐。 |
| 多任务监督微调 | 一种训练框架,将标签感知翻译分解为多个难度递增的子任务,通过监督微调同时学习,以促进能力获取和知识迁移。 |
| 标签保真度 | 衡量翻译系统在译文中正确保留源文本中格式标签的结构、语义和功能意义的程度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅