该研究指出,生成式AI智能体的持续部署不能仅以单次任务成功为标准,还需在反复交互、环境变化和人际依赖中保持有用性。作者提出“运营韧性”与“体谅性参与”两个互补评估维度,前者关注智能体在受阻时如何恢复并沟通自身局限,后者关注其适应过程是否顾及受影响的人、角色边界与整体工作流。研究构建了120条模拟医疗轨迹,覆盖两种生成式AI模型和十二项任务,设置轻、中、重三级累积挑战,并对比文本行动计划、提示式内部评估和结构化工作量与情感报告。结果显示,随着挑战累积,智能体在运营韧性上从自主恢复转向更多依赖人类,结构化报告显示工作量和负面情绪上升,但文本回应中很少表达压力;在体谅性参与上,智能体从任务聚焦型适应扩展到任务重构、关注他人、调整角色边界和更广协调。研究据此提出涉及坚持、注意力、角色边界、状态披露和升级的五种部署困境,强调需由利益相关方明确规范,并对学习、情境化评估和具身适应提出技术启示。
| 操作韧性 | 智能体在遇到工作受阻时恢复并保持进展、同时传达自身局限的能力。 |
| 体谅性参与 | 智能体在适应过程中考虑受影响人员、角色边界和周围工作流的参与方式。 |
| 累积挑战 | 技术、人力和运营中断随时间不断叠加,对智能体持续部署构成的复合压力。 |
| 部署困境 | 智能体在实际部署中面临的需利益相关者明确规定的两难问题,如坚持、注意力、角色边界等。 |
| 情境化评估 | 在具体工作流和真实交互情境中评估智能体表现,而非仅依赖孤立任务成功指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅