50%剪枝让Whisper错误差距翻倍,每分钟纠错从30秒飙到64秒!
Temporal Taxation Compounds Under Post-Training Compression of Whisper Models
arXiv CL (cs.CL) 重要 #模型压缩#公平性#语音识别 🕐 今天 12:00

📖 AI 总结

这篇论文研究后训练压缩是否会重新分配语音识别模型的误差负担。作者在Whisper系列模型上,使用Fair-Speech、Common Voice 25和AfriSpeech-200数据集进行测试,发现50% Wanda剪枝使Whisper-large-v3在Fair-Speech上最差与最优群体间的词错误率差距扩大一倍以上,按每个错误五秒修正成本计算,每分钟语音的修正时间从30秒升至64秒,相对增幅达111%,且该结果对成本假设不敏感,通过音频质量控制,束搜索解码也仅能部分缓解。在边缘模型规模下,INT4 HQQ量化使西非口音的灾难性转录循环增加五到七倍。蒸馏则在27个评估设置中的21个缩小了群体差距。研究将时间税负概念量化为指标,指出仅对全精度模型进行单次公平性审计无法反映压缩在部署时给边缘群体带来的实际负担。

🔑 关键词速览

时间征税 (Temporal Taxation)指语音识别错误导致用户需要额外花费时间纠正转录,从而对特定群体造成不成比例的时间负担。
训练后压缩 (Post-Training Compression)在模型训练完成后,通过量化、剪枝或蒸馏等技术减小模型大小和计算需求的过程。
Wanda剪枝 (Wanda Pruning)一种基于权重重要性的剪枝方法,通过移除对输出影响较小的权重来压缩模型。
INT4 HQQ量化 (INT4 HQQ Quantization)一种将模型权重压缩到4位整数的量化技术,使用HQQ(半二次量化)方法以减少精度损失。
词错误率 (Word Error Rate, WER)语音识别中衡量转录准确性的指标,计算为错误词数占总词数的比例。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅