该研究提出一种有损压缩文本自编码器,在数据压缩与表示学习的交叉领域探索文本的压缩潜在表示。模型采用沿时间轴对隐藏表示进行残差降采样与升采样,并引入残差低维离散瓶颈,系统分析了不同量化方法、训练目标和数据集下的表现。研究从表层(BLEU)和语义(基于大语言模型的评判)两个层面评估原始文本与重建文本的相似度,并在下游问答和语义文本相似度基准上测试。结果显示,该方法在网页文本上以每字节2.24比特的压缩率达到了与无损压缩算法相当的水平,同时保持良好的重建质量和下游任务性能,表明有损压缩表示在文本处理中具有实用潜力。
| 自编码器 | 一种神经网络,通过编码器将输入压缩为潜在表示,再通过解码器重建输入。 |
| 残差下采样/上采样 | 在时间轴上对隐藏表示进行降低或提升分辨率的操作,并引入残差连接以保留信息。 |
| 离散瓶颈 | 低维的离散潜在空间,用于压缩表示并限制信息容量。 |
| 量化方法 | 将连续潜在表示转换为离散值的技术,常用于压缩和减少表示精度。 |
| BLEU | 一种评估文本生成质量的指标,通过比较生成文本与参考文本的n-gram重叠度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅