该研究提出MonoTM,一种可解释的主题建模框架,旨在突破传统主题模型仅依赖高频词描述主题语义的局限。作者指出,稀疏自编码器(SAE)虽能从稠密表示中提取可解释特征,但特征可解释性与主题推断质量之间的关系尚不明确。MonoTM将二者解耦:文档—主题混合估计使用完整的SAE特征袋表示,而在混合比例固定后,再基于另一套语料锚定的语义特征词汇表学习主题描述符。在三个基准语料上的实验表明,混合估计与语义解释偏好不同的SAE配置和特征子集。该设计在保留全局主题结构的同时,以比单个词更具意义的语义单元表示主题,从而提升了下游语料分析的实用性。
| MonoTM | 本文提出的可解释主题建模框架,将主题混合估计与语义解释解耦,使用稀疏自编码器特征表示主题。 |
| 稀疏自编码器 (SAE) | 一种神经网络,通过稀疏性约束从稠密表示中提取可解释的特征,常用于表示学习。 |
| 主题模型 | 一种统计模型,用于从文本语料中发现抽象主题,通常以词分布表示主题。 |
| 文档-主题混合 | 文档中各个主题所占的比例分布,表示文档的语义组成。 |
| 特征可解释性 | 指模型提取的特征能够被人类理解并赋予语义含义的程度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅