20B大模型压到4.5GiB,ESTS六份WMT26提交靠路由剪专家!
ESTS at WMT26: Routing-Informed Expert Pruning for Model Compression
arXiv CL (cs.CL) 重要 #模型压缩#MoE#机器翻译 🕐 09-14 12:00

📖 AI 总结

本文介绍了ESTS团队参加WMT26无约束模型压缩共享任务的六项提交方案,覆盖英译简中与英译埃及阿拉伯语两个方向,均以GPT-OSS-20B为基础模型。方法核心是利用任务特定的路由质量对专家进行重要性排序,并借助跨语言路由差异在层间分配保留容量,随后物理移除低重要性专家;所得专用模型在GPT-5.1生成的合成翻译数据上进行恢复微调,并对保留的专家投影权重施加MXFP4量化以进一步压缩。团队还针对指令条件下的WMT26设置实现了稳健推理系统,包含类别推断、输出校验、重试、分段回退和源端JSON重建等机制。六项提交的参数量介于4.186B至7.770B之间,打包产物大小为4.55至6.33 GiB,并采用基于GPT-5.1伪参考的xCOMET-XL内部评估对各压缩工作点进行比较。该工作展示了路由信息在专家剪枝与容量分配中的实用价值,为大规模混合专家模型的多语言压缩提供了可参考的工程路径。

🔑 关键词速览

GPT-OSS-20B一个拥有200亿参数的开源大语言模型,作为本工作压缩任务的基座模型。
路由质量在混合专家模型中,用于衡量每个专家对特定任务重要性的指标,基于路由分配权重计算。
MXFP4量化一种将模型权重压缩为4位浮点数的量化方法,旨在减少模型存储和计算开销。
xCOMET-XL一种基于跨语言预训练模型的机器翻译质量评估指标,用于自动评价翻译输出。
专家剪枝从混合专家模型中移除冗余或低重要性专家的模型压缩技术,以降低参数量和计算成本。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅