该综述系统梳理了以终端为交互媒介的AI智能体研究,提出将终端智能体定义为“以命令执行、文本反馈和有状态环境交互为核心行动-观察循环”的系统。文章构建了七维终端能力画像,从系统架构、能力获取与评估三个层面建立统一分析框架。核心发现包括:终端智能体的实际行为由模型、接口、框架、运行时和环境共同塑造;可执行轨迹能将学习锚定在行动结果、验证与恢复中,但现有评估多侧重最终结果,对过程质量、恢复能力和治理机制覆盖不均。通过固定条件诊断实验,作者指出不同基准族会暴露不同过程信号,系统对比显示性能高度依赖基准选择,组件归因存在局限。研究建议在报告中明确系统与运行时条件,并配套可回放轨迹和过程级证据,为软件工程及新兴应用领域的终端智能体研究提供了统一基础。
| Terminal Agents | 通过终端命令行环境进行交互和操作的人工智能代理系统。 |
| Terminal-Mediated Execution | 以终端命令执行为核心的交互方式,强调文本反馈和环境状态变化。 |
| Seven-Dimensional Terminal Competence Profile | 用于评估终端代理能力的七个维度框架,涵盖架构、学习、评估等方面。 |
| Executable Trajectories | 可执行的行动序列,用于将学习与行动后果和验证相结合。 |
| Component Attribution | 将系统性能归因于特定组件(如模型或接口)的过程,常受基准依赖限制。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅