本文针对气候文献增长快于人工审阅速度、而社会临界点证据通常仅散见于长文档个别段落的问题,提出了一套开放、模块化的Transformer框架,可在段落级别自动检测并结构化此类证据。该框架整合五个组件:用于切分的DistilBERT边界分割器、经迭代增强的RoBERTa分类器、用于改写检测段落的Mistral 7B、依据五项已发表社会临界点标准打分的LLaMA 3.2 3B,以及用于语义检索的Milvus向量库,并通过Streamlit界面与MinIO存储封装为可部署流程。在163段GPT-4.1标注基准和51段专家复核集上,分割器以6.137的九指标综合得分优于三种对比方法;调优后的RoBERTa在全基准上准确率71.4%、Cohen's kappa为0.337,在带标签段落上准确率达87.5%、kappa为0.742,优于气候领域专用模型和未调优语言模型。该工作为气候社会临界点证据的系统化发现与组织提供了可复用的自动化方案。
| Social Tipping Point | 社会临界点,指社会系统中微小变化触发快速、自我强化变化的阈值。 |
| DistilBERT | 一种轻量级BERT模型,通过知识蒸馏压缩,用于文本分割任务。 |
| RoBERTa | 一种鲁棒优化的BERT预训练模型,用于文本分类和检测任务。 |
| Cohen's kappa | 衡量分类模型与人工标注一致性的统计指标,排除随机一致。 |
| Milvus | 一个开源的向量数据库,用于高效存储和检索语义向量。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅