本文研究如何利用大语言模型对文本语料库进行可视化探索,提出“零样本可视化”(ZSV)任务:用户以自然语言指定概念,文档被映射到相应概念轴上以供可视化。由于该任务涉及特征函数选择、实现效率权衡及前后处理决策等复杂问题,作者构建了一个基准,系统比较嵌入相似度、直接语义判断和条件似然估计三类方法,并从语义忠实度、分数保真度和计算成本等维度进行评估。结果表明,基于下一词概率的评分方法在实用性上综合表现最佳。作者进一步将该方法应用于无标注语料库,发现分级轴结合二元相关性过滤的设计优势,并揭示离题文档中存在复合情感偏差。基于这些发现,文章为构建端到端ZSV基线提供了实用指南。
| Zero-Shot Visualization (ZSV) | 零样本可视化,一种无需针对特定概念训练即可将文档映射到用户指定概念轴上的可视化任务。 |
| Concept Axes | 概念轴,用户以自然语言指定的语义维度,文档依据其与这些维度的关联程度被映射到相应位置。 |
| Next-Token Probabilities | 下一词元概率,语言模型对序列中下一个词元预测的概率分布,此处用于对文档与概念的相关性进行评分。 |
| Semantic Faithfulness | 语义忠实度,衡量可视化结果在多大程度上忠实反映文档与指定概念之间的真实语义关系。 |
| Score Fidelity | 分数保真度,评估评分方法产生的数值分数是否准确、可靠地反映文档与概念之间的关联强度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅