用SciBERT自动分类望远镜文献,仅512词限制却拿下0.89高分,登顶WASP-2025排行榜!
Efficient Context-Limited Telescope Bibliography Classification for the WASP-2025 Shared Task Using SciBERT
arXiv LG (cs.LG) #文本分类#科学文献 🕐 09-03 12:00

📖 AI 总结

该研究提出了一种基于SciBERT的自动分类方法,用于解决天文望远镜文献编目中的人工分类难题。该方法将科学论文划分为科学、仪器、提及和非望远镜四类,在WASP-2025共享任务中取得榜首成绩,宏F1分数达0.89。研究在严格限制512个token上下文长度和有限计算资源的条件下,分析了截断策略对分类效果的影响,发现即便半数样本超出长度限制,SciBERT的领域适配能力仍能保证稳健分类。论文还比较了截断、分块与长上下文模型间的效率权衡,为科学文本整理的资源优化提供了实践参考。该成果有助于提升天文台科研影响力评估的效率和可重复性。

🔑 关键词速览

SciBERT一种基于BERT的预训练语言模型,专门针对科学文献进行训练,以更好地理解科学文本。
WASP-2025 Shared Task一个共享任务挑战,旨在解决望远镜文献分类问题,并设有排行榜评估性能。
Macro F1 score一种分类性能指标,计算每个类别的F1分数的算术平均值,适用于不平衡数据集。
Context-length constraints模型输入序列的最大长度限制,通常为512个标记,超出部分需截断或分块处理。
Truncation将超过模型最大输入长度的文本截断为前N个标记,可能导致信息丢失。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅