本文提出一种面向循环神经网络的知识蒸馏框架MemKD,旨在解决LSTM等时序模型因计算复杂度高、参数量大而难以部署于可穿戴设备和边缘计算平台的问题。作者指出,现有知识蒸馏方法多源自计算机视觉任务,忽视了时序模型特有的时间依赖与记忆保持特性。为此,MemKD设计了一种专门的损失函数,用于捕捉教师模型与学生模型在时间序列各子序列上的记忆保持差异,从而引导学生模型更有效地模仿教师行为。在扩展的时序基准实验中,MemKD显著优于现有最先进的知识蒸馏方法,并能在多种压缩比例下达到与教师模型相当的精度,同时大幅减少参数量和内存占用。该工作为资源受限场景下的实时时序分析提供了可行路径。
| Knowledge Distillation (KD) | 一种模型压缩技术,通过将大型教师模型的知识迁移到小型学生模型,在降低计算需求的同时保持性能。 |
| Recurrent Neural Networks (RNNs) | 一类用于处理序列数据的神经网络,具有循环连接以捕捉时间依赖性,常用于时间序列分析。 |
| Memory Retention | 模型在序列处理过程中保持和利用历史信息的能力,对时间序列任务中的长期依赖建模至关重要。 |
| MemKD | 本文提出的记忆差异知识蒸馏框架,通过专门损失函数捕捉教师与学生模型在子序列上的记忆保持差异。 |
| Edge Computing | 一种分布式计算范式,将计算和数据存储推向网络边缘,适用于资源受限环境中的实时应用。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅