AI气象学家问世!推理准确率翻倍,终结天气播报数值幻觉
AFDBench: A Reasoning-First AI Scientist for NationalWeather Service Forecast Discussions
arXiv LG (cs.LG) 重要 #评测基准#多模态 🕐 08-27 12:00

📖 AI 总结

本文介绍了AFDBench,一个面向国家气象局天气预报讨论文本的生成式AI评估基准与训练框架。研究指出,大语言模型在生成高风险的天气预报文本时容易出现数值幻觉,影响气象信息传达的可靠性。为此,作者构建了包含7,732篇来自13个NWS办公室的专家撰写讨论文本,并配套真实AI气象预报数据,同时提出三项评估指标:数值准确性(Met-Align)、专业文体一致性(Style-Align)和输入数据忠实度(Input-Grounding)。零样本测试显示,开源模型在专业文体上得分较低(约0.33),对输入数据的利用也不够充分。通过引入基于领域奖励的GRPO强化学习,模型在两个未见NWS办公室的1,033个样本上,Style-Align从0.318提升至0.619,Input-Grounding从0.881提升至0.940,显著增强了模型撰写专业气象文本和解读AI数据的能力。该研究为气象领域生成式AI的可信应用提供了新思路。

🔑 关键词速览

AFDBench一个用于评估生成式气象推理的基准,包含NWS讨论和AI天气数据输入。
Area Forecast Discussions (AFDs)区域预报讨论,是气象学家撰写的详细天气分析和预报文本。
Met-Align一个评估指标,用于衡量生成文本中数值的准确性。
Style-Align一个评估指标,用于衡量生成文本对专业气象语域的遵循程度。
Input-Grounding一个评估指标,用于衡量生成文本对输入天气数据的忠实度。
Group Relative Policy Optimization (GRPO)一种强化学习算法,通过组内相对奖励优化策略,用于训练模型。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅