本文介绍了ESTS团队参加WMT26无约束模型压缩共享任务的六项提交方案,覆盖英译简中与英译埃及阿拉伯语两个方向,均以GPT-OSS-20B为基础模型。方法核心是利用任务特定的路由质量对专家进行重要性排序,并借助跨语言路由差异在层间分配保留容量,随后物理移除低重要性专家;所得专用模型在GPT-5.1生成的合成翻译数据上进行恢复微调,并对保留的专家投影权重施加MXFP4量化以进一步压缩。团队还针对指令条件下的WMT26设置实现了稳健推理系统,包含类别推断、输出校验、重试、分段回退和源端JSON重建等机制。六项提交的参数量介于4.186B至7.770B之间,打包产物大小为4.55至6.33 GiB,并采用基于GPT-5.1伪参考的xCOMET-XL内部评估对各压缩工作点进行比较。该工作展示了路由信息在专家剪枝与容量分配中的实用价值,为大规模混合专家模型的多语言压缩提供了可参考的工程路径。
| GPT-OSS-20B | 一个拥有200亿参数的开源大语言模型,作为本工作压缩任务的基座模型。 |
| 路由质量 | 在混合专家模型中,用于衡量每个专家对特定任务重要性的指标,基于路由分配权重计算。 |
| MXFP4量化 | 一种将模型权重压缩为4位浮点数的量化方法,旨在减少模型存储和计算开销。 |
| xCOMET-XL | 一种基于跨语言预训练模型的机器翻译质量评估指标,用于自动评价翻译输出。 |
| 专家剪枝 | 从混合专家模型中移除冗余或低重要性专家的模型压缩技术,以降低参数量和计算成本。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅