本文提出DeReAct,一种模块化智能体架构,旨在解决ReAct类智能体因单一LLM策略同时负责动作提议、环境交互与完成判定而导致的错误传播和缺乏依据的完成声明问题。DeReAct将两个门控策略外置:Critic在执行前验证提议动作,Context Manager重建环境支持的状态并认证任务完成。在GAIA和SWE-bench Verified基准上,DeReAct对较弱Brain模型的Pass@1提升最为显著,Qwen3-Coder-480B提升6.5至7.0个百分点,Claude Sonnet 4.5提升4.2至5.2个百分点,且增益随Brain能力增强而递减。轨迹与消融分析表明,当目标性失败足够普遍且门控策略本身充分时,外部门控才有效。使用Claude Opus 4.5时,DeReAct的Pass@1与ReAct相当,但生成的轨迹在证据完整性和约束满足方面更优,说明完成控制可以以更早终止换取更强的依据性。总体而言,该架构在提升较弱智能体的同时,随模型增强仍保留依据性收益。
| ReAct | 一种将推理(Reasoning)与行动(Acting)交替进行的智能体范式,由单一 LLM 策略统一驱动。 |
| DeReAct | 本文提出的模块化智能体架构,通过外置 Critic 和 Context Manager 两个门控策略来解耦动作验证与完成控制。 |
| Critic | DeReAct 中的动作验证模块,在执行前对 LLM 提出的动作进行授权检查。 |
| Context Manager | DeReAct 中的状态重建与完成认证模块,负责构建环境支持的 State 并判定任务是否真正完成。 |
| Pass@1 | 衡量智能体在单次尝试中成功完成任务的评估指标,常用于 GAIA 和 SWE-bench 等基准。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅