主题建模新突破!MonoTM解耦语义与推断,超越词级描述!
Beyond Top Words: MonoTM for Topic Modeling with Interpretable Monosemantic Features
arXiv CL (cs.CL) 重要 #主题建模#稀疏自编码器#可解释性#文本分析 🕐 09-10 12:00

📖 AI 总结

该研究提出MonoTM,一种可解释的主题建模框架,旨在突破传统主题模型仅依赖高频词描述主题语义的局限。作者指出,稀疏自编码器(SAE)虽能从稠密表示中提取可解释特征,但特征可解释性与主题推断质量之间的关系尚不明确。MonoTM将二者解耦:文档—主题混合估计使用完整的SAE特征袋表示,而在混合比例固定后,再基于另一套语料锚定的语义特征词汇表学习主题描述符。在三个基准语料上的实验表明,混合估计与语义解释偏好不同的SAE配置和特征子集。该设计在保留全局主题结构的同时,以比单个词更具意义的语义单元表示主题,从而提升了下游语料分析的实用性。

🔑 关键词速览

MonoTM本文提出的可解释主题建模框架,将主题混合估计与语义解释解耦,使用稀疏自编码器特征表示主题。
稀疏自编码器 (SAE)一种神经网络,通过稀疏性约束从稠密表示中提取可解释的特征,常用于表示学习。
主题模型一种统计模型,用于从文本语料中发现抽象主题,通常以词分布表示主题。
文档-主题混合文档中各个主题所占的比例分布,表示文档的语义组成。
特征可解释性指模型提取的特征能够被人类理解并赋予语义含义的程度。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅