该研究系统评估了大型语言模型在航空管制通信场景中的实际应用能力。研究者以旧金山湾区某次实验性通用航空飞行的真实管制对话为基准,设计了五种约束程度递增的提示词结构,并嵌入有状态的多轮对话管线中,让模型扮演管制员角色。实验覆盖九种开源与闭源模型,通过词汇、结构、语义相似度及经人工验证的LLM裁判进行评分。关键发现是:提供示范样例能提升输出相似度,但强化提示词约束反而适得其反——最轻量的提示词表现最佳,而高度脚本化的提示词会因错误在对话中累积而失效,注入正确历史信息可修复这一问题。研究为LLM辅助航空管制的可行路径与当前局限提供了实证依据。
| Air Traffic Control (ATC) | 空中交通管制,指地面人员通过通信引导飞机安全飞行的系统。 |
| Large Language Models (LLMs) | 大型语言模型,如GPT系列,能够生成和理解自然语言文本的深度学习模型。 |
| Prompt Engineering | 提示工程,设计输入提示以引导语言模型输出特定结果的技术。 |
| In-context Example | 上下文示例,在提示中提供示例以帮助模型理解任务或格式。 |
| LLM-as-judge | 使用大型语言模型作为评估者,对生成文本质量进行打分的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅