苹果端侧听写分词器竟能蒸馏压缩,直接省内存降功耗!
Compressing Streaming Neural Audio Encoders via Latent-Space Distillation
Apple ML Research 重要 论文方法多模态算力 🕐 09-24 08:00

📖 AI 总结

苹果研究团队提出一种通过潜在空间蒸馏压缩流式神经音频编码器的方法。该编码器作为设备端听写系统的分词器,将音频波形映射为语言模型可读的表示,其参数量直接影响内存占用、功耗与延迟。与传统蒸馏以离散token或输出分布为监督目标不同,该方法直接让学生编码器回归教师模型量化前的逐帧潜在表示,并用单层仿射变换吸收师生宽度差异。由于该目标位于量化器和语言模型桥接之前,一套方案即可覆盖两种token接口,并适用于单独预训练和与语言模型联合训练的分词器。实验显示,在2.8倍压缩率下,蒸馏后的学生模型在六组师生配对中的五组上相对WER与教师差距不超过1.9%,无需微调,且比同等容量的独立训练分词器相对提升3.9%。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅