该研究探讨了在自主目标驱动的多智能体AI组织中,治理机制何时能有效提升任务表现。作者基于321份文献的质性证据整合,提出GAMPO框架,并在医疗保健基准CHI-Bench上对开源及前沿模型进行提示层测试。核心发现是治理收益存在边界条件:受限于模型的剩余能力,且具有领域和模型特异性。在能力受限的开源模型中,完整流程无稳定收益,而简单指令可使任务成功率翻倍;在前沿模型中,同一框架效果差异显著,甚至出现零收益,归因于模型固有的推荐覆盖倾向。进一步实验表明,用基于个案政策和标准的盲答式“完成定义”替代通用流程,可将授权任务成功率提升至84%。研究贡献在于提出可审计的治理框架,并证明治理设计应匹配模型剩余能力,案例导向规范优于统一流程,但结论属探索性,样本量有限。
| GAMPO | 受治理的自主多智能体产品组织框架,整合代理、敏捷、平台和治理理论,用于设计受治理的AI智能体组织。 |
| Autotelic AI agent | 自主目标AI智能体,指能够自我生成目标并追求这些目标的AI系统。 |
| CHI-Bench | 一个长周期医疗保健基准,用于评估AI智能体在复杂医疗任务中的表现。 |
| Definition-of-done | 任务完成标准,指针对每个任务明确规定的完成条件,用于评估智能体输出质量。 |
| Self-consistency | 自一致性,一种通过多次采样并选择最一致答案来提高推理准确性的技术。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅