这项研究评估了在科学任务中使用职业专属系统提示词的实际效果。作者构建了包含503个职业专属提示词配置的开源语料库Scientific Agents,并以Gemini 3.8 Flash为测试模型,在九个文本类科学基准(共4,531道抽样题目、100个匹配配置)上,将完整职业提示词与四种对照条件进行比较,包括极简基线、角色开场句、通用科学严谨性指南以及无关领域提示词。结果显示,完整职业提示词相比极简基线平均准确率差异为-0.6个百分点,没有任何基准出现统计上明确的提升,同时输出token量增加1.5至2.3倍,每次成功调用成本高出2.2至4.5倍。在60道需使用工具的BioMysteryBench生物信息学问题上,职业提示词的平均解决率为46.7%,反而低于基线的56.7%,主要原因是更频繁触发token与时间限制。研究还发现,较长提示词在SuperGPQA上因API中断而表现出更高的首次正确率,但这一优势同样出现在通用和错配提示词中,说明其来源是提示词长度或格式而非领域专业性。研究结论是,对受测模型和任务而言,默认加载完整职业提示词并不能提升准确率,反而显著增加成本,未来需进一步检验选择性检索提示词片段或开放式科学任务是否会改变这一结论。
| Scientific Agents | 一个包含 503 个专业特定 AGENTS.md 配置的开源语料库,用于评估科学任务中的系统提示。 |
| AGENTS.md | 一种定义智能体角色和行为的配置文件,通常包含专业特定的系统提示。 |
| Gemini 3.8 Flash | 谷歌开发的大型语言模型,用于本研究的智能体测试。 |
| BioMysteryBench | 一个包含 60 个生物信息学问题的基准测试,用于评估智能体在工具使用任务上的表现。 |
| SuperGPQA | 一个用于评估模型在科学问题上准确率的基准测试,本研究关注其首次通过正确率。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅