该研究对六款主流生成式AI应用(ChatGPT、Gemini、Microsoft Copilot、Claude、DeepSeek和Perplexity)在Google Play与苹果App Store上的17012条英文评论进行了跨平台分析,结合BERTopic主题建模与RoBERTa情感分类,并采用卡方检验、Kruskal-Wallis检验及多项逻辑回归评估应用间差异。结果显示,负面情绪主要集中在广告(91%)、身份验证(89%)、服务器可靠性(83%)和订阅定价(73%)等方面;各应用间情感分布差异显著,其中Claude负面情绪比例最高(47.7%),但同时拥有高度热情的用户群体,呈现显著极化特征。研究还发现部分DeepSeek评论涉及其中国背景引发的地缘政治与数据隐私担忧,并提出"信任摩擦分数"以量化各应用的信任与可用性障碍。该研究为用户信任与采用障碍提供了经人工编码验证的实证依据。
| BERTopic | 一种基于BERT嵌入和聚类算法的主题建模技术,用于从文本中自动发现潜在主题。 |
| RoBERTa | 一种鲁棒优化的BERT预训练语言模型,常用于文本分类和情感分析任务。 |
| Kruskal-Wallis | 一种非参数统计检验方法,用于比较多个独立样本的中位数是否存在显著差异。 |
| Bonferroni correction | 一种多重比较校正方法,通过调整显著性水平来控制整体第一类错误率。 |
| Trust Friction Score | 本文提出的一个综合指标,用于量化用户在使用生成式AI应用时遇到的信任和可用性障碍。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅