🔥 今日值得一读 设备端NER大评测:9个模型横跨1300万到80亿参数,40亿LLM准确率竟能打平专业模型!
On-Device Named-Entity Recognition: A Deployability Study of Accuracy, Cost, Reliability, and Confidence
arXiv CL (cs.CL) 🔥 重点 #命名实体识别#端侧部署#评测基准 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
帮助开发者选择可本地部署的NER模型,并判断其置信度是否可信。

📖 AI 总结

这篇论文研究本地设备端命名实体识别(NER)的实际可部署性,而非单纯比较榜单精度。作者在三个数据集上评测了九套系统,涵盖经典标注器spaCy、双向编码器GLiNER以及本地运行的生成式大模型,参数量从1300万到80亿不等,并额外考察延迟与输出有效性两个常被忽略的维度。由于RSS-News语料缺乏金标准,作者用跨家族LLM评审团构建银标准,再经人工复核验证,严格F1达0.95。关键发现是:金标准来源会改变范式排名,从LLM银标准转向人工金标准后,编码器普遍提升而生成模型普遍下降;4B指令模型在干净新闻文本上精度领先,但编码器以九分之一至二十四分之一的体量达到相近水平,延迟为毫秒至秒级且无畸形输出,而最小生成模型在长输入上畸形输出率高达27%,该问题只能靠扩大规模解决。研究还刻画了GLiNER的置信度:排序能力尚可(AUROC 0.76至0.86)但过度自信,温度缩放可减半校准误差,阈值化带来小幅真实F1增益,级联路由收益有限且依赖语料。

🔑 关键词速览

Named-Entity Recognition (NER)命名实体识别,从文本中识别并分类人名、地名、组织名等实体的自然语言处理任务。
On-Device设备端,指模型直接在本地设备(如手机、电脑)上运行,无需调用云端API,保证低延迟和数据隐私。
GLiNER一种双向编码器专家模型,专为命名实体识别设计,参数规模在1.66亿到4.6亿之间。
AUROC接收者操作特征曲线下面积,衡量模型排序正确性的指标,值越高表示排序能力越强。
ECE期望校准误差,衡量模型置信度与实际正确率之间的偏差,值越低表示校准越好。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅