该研究提出了一种基于SciBERT的自动分类方法,用于解决天文望远镜文献编目中的人工分类难题。该方法将科学论文划分为科学、仪器、提及和非望远镜四类,在WASP-2025共享任务中取得榜首成绩,宏F1分数达0.89。研究在严格限制512个token上下文长度和有限计算资源的条件下,分析了截断策略对分类效果的影响,发现即便半数样本超出长度限制,SciBERT的领域适配能力仍能保证稳健分类。论文还比较了截断、分块与长上下文模型间的效率权衡,为科学文本整理的资源优化提供了实践参考。该成果有助于提升天文台科研影响力评估的效率和可重复性。
| SciBERT | 一种基于BERT的预训练语言模型,专门针对科学文献进行训练,以更好地理解科学文本。 |
| WASP-2025 Shared Task | 一个共享任务挑战,旨在解决望远镜文献分类问题,并设有排行榜评估性能。 |
| Macro F1 score | 一种分类性能指标,计算每个类别的F1分数的算术平均值,适用于不平衡数据集。 |
| Context-length constraints | 模型输入序列的最大长度限制,通常为512个标记,超出部分需截断或分块处理。 |
| Truncation | 将超过模型最大输入长度的文本截断为前N个标记,可能导致信息丢失。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅