本文针对研究计算领域的一个常见疑问——大语言模型是否应当取代朴素贝叶斯等经典方法——展开了系统性基准测试。作者将补集朴素贝叶斯与来自四个模型家族、参数规模跨越27B至1T(混合专家架构)的零样本和少样本LLM进行对比,覆盖多种文本分类任务。结果显示,LLM仅在零数据场景下占优,例如在Amazon Polarity情感任务上达到98.0%对88.2%,但这一优势易受数据污染影响;在低污染情感任务中,朴素贝叶斯反而以81.7%对73.0%胜出。一旦具备标注数据(如AG News),朴素贝叶斯达到89.1%的准确率,与零样本27B LLM(89.0%)在统计上无差异,且优于397B前沿模型(84.8%),同时能在普通CPU上以每秒数千样本的速度运行。吞吐量分析表明,小模型批量GPU推理比朴素贝叶斯CPU推理慢40至486倍,每样本能耗约低两个数量级。研究还刻画了任务相关的决策边界,并提供了基于Kubernetes Helm的自动化模型选择工具。
| Complement Naive Bayes | 补集朴素贝叶斯,一种针对不平衡数据集的朴素贝叶斯变体,通过使用补集类别的统计量来改进分类性能。 |
| Zero-shot LLMs | 零样本大型语言模型,指无需任何任务特定训练数据即可直接执行任务的模型。 |
| Few-shot LLMs | 少样本大型语言模型,指仅需少量示例即可适应新任务的模型。 |
| Mixture-of-Experts | 专家混合模型,一种稀疏激活的神经网络架构,其中多个专家子网络被组合以提升模型容量和效率。 |
| Kubernetes Helm operator | Kubernetes Helm操作器,一种用于自动化在Kubernetes集群上部署和管理应用程序的工具,基于Helm图表。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅