该论文针对词-文档矩阵的谱协同聚类问题,提出两种随机化SVD近似方法,以缓解传统方法在高维数据上因完整奇异值分解而带来的高昂计算成本。第一种方法通过随机投影实现随机化SVD,第二种方法将部分SVD与逐元素随机采样相结合,二者均适用于文档簇与词簇数量可能不同的归一化谱协同聚类场景。在真实与合成数据集上的实验表明,两种方法相较完整SVD基线均能降低运行时间,但其表现受矩阵稀疏性影响:随机投影方法在各类测试设置下更为稳定可靠,而基于采样的方法更适合较稠密矩阵,在本身已稀疏的文本数据上收益有限。研究结论指出,谱协同聚类的随机化近似方法应根据数据底层结构进行选择。
| Spectral Co-Clustering | 谱共聚类:一种同时将行和列(如词和文档)划分到簇中的方法,利用矩阵的谱(特征值/奇异值)结构发现潜在的双向聚类模式。 |
| SVD (Singular Value Decomposition) | 奇异值分解:将矩阵分解为三个矩阵乘积的线性代数技术,是谱聚类和降维的核心工具,但计算成本随矩阵规模增长。 |
| Randomized SVD | 随机SVD:通过随机投影或采样来近似计算矩阵的奇异值分解,以降低计算复杂度,适用于大规模数据。 |
| Random Projection | 随机投影:将高维数据乘以随机矩阵映射到低维空间,同时近似保持数据点之间的距离或结构,常用于加速矩阵分解。 |
| Word-Document Matrix | 词-文档矩阵:文本挖掘中的常见数据结构,行表示词、列表示文档,元素通常为词频或TF-IDF权重,用于表示文本语料。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅