别急着淘汰朴素贝叶斯!零样本LLM仅领先10个百分点,有标注数据时NB反超397B大模型,CPU推理快40-486倍
LLMs or Naive Bayes? Old Gems or New Ways
arXiv LG (cs.LG) 重要 #文本分类#LLM评测#朴素贝叶斯#少样本学习 🕐 09-15 12:00

📖 AI 总结

本文针对研究计算领域的一个常见疑问——大语言模型是否应当取代朴素贝叶斯等经典方法——展开了系统性基准测试。作者将补集朴素贝叶斯与来自四个模型家族、参数规模跨越27B至1T(混合专家架构)的零样本和少样本LLM进行对比,覆盖多种文本分类任务。结果显示,LLM仅在零数据场景下占优,例如在Amazon Polarity情感任务上达到98.0%对88.2%,但这一优势易受数据污染影响;在低污染情感任务中,朴素贝叶斯反而以81.7%对73.0%胜出。一旦具备标注数据(如AG News),朴素贝叶斯达到89.1%的准确率,与零样本27B LLM(89.0%)在统计上无差异,且优于397B前沿模型(84.8%),同时能在普通CPU上以每秒数千样本的速度运行。吞吐量分析表明,小模型批量GPU推理比朴素贝叶斯CPU推理慢40至486倍,每样本能耗约低两个数量级。研究还刻画了任务相关的决策边界,并提供了基于Kubernetes Helm的自动化模型选择工具。

🔑 关键词速览

Complement Naive Bayes补集朴素贝叶斯,一种针对不平衡数据集的朴素贝叶斯变体,通过使用补集类别的统计量来改进分类性能。
Zero-shot LLMs零样本大型语言模型,指无需任何任务特定训练数据即可直接执行任务的模型。
Few-shot LLMs少样本大型语言模型,指仅需少量示例即可适应新任务的模型。
Mixture-of-Experts专家混合模型,一种稀疏激活的神经网络架构,其中多个专家子网络被组合以提升模型容量和效率。
Kubernetes Helm operatorKubernetes Helm操作器,一种用于自动化在Kubernetes集群上部署和管理应用程序的工具,基于Helm图表。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅