🔥 今日值得一读 AI智能体新架构DeReAct:弱模型性能飙升7分,动作验证与完成控制独立把关!
DeReAct: Decomposed Reasoning and Acting for Reliable AI Agents
arXiv AI (cs.AI) 🔥 重点 #Agent#ReAct#可靠性 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
解决ReAct Agent错误传播和虚假完成问题,通过独立门控策略提升工具调用可靠性,可直接集成到现有Agent框架。

📖 AI 总结

本文提出DeReAct,一种模块化智能体架构,旨在解决ReAct类智能体因单一LLM策略同时负责动作提议、环境交互与完成判定而导致的错误传播和缺乏依据的完成声明问题。DeReAct将两个门控策略外置:Critic在执行前验证提议动作,Context Manager重建环境支持的状态并认证任务完成。在GAIA和SWE-bench Verified基准上,DeReAct对较弱Brain模型的Pass@1提升最为显著,Qwen3-Coder-480B提升6.5至7.0个百分点,Claude Sonnet 4.5提升4.2至5.2个百分点,且增益随Brain能力增强而递减。轨迹与消融分析表明,当目标性失败足够普遍且门控策略本身充分时,外部门控才有效。使用Claude Opus 4.5时,DeReAct的Pass@1与ReAct相当,但生成的轨迹在证据完整性和约束满足方面更优,说明完成控制可以以更早终止换取更强的依据性。总体而言,该架构在提升较弱智能体的同时,随模型增强仍保留依据性收益。

🔑 关键词速览

ReAct一种将推理(Reasoning)与行动(Acting)交替进行的智能体范式,由单一 LLM 策略统一驱动。
DeReAct本文提出的模块化智能体架构,通过外置 Critic 和 Context Manager 两个门控策略来解耦动作验证与完成控制。
CriticDeReAct 中的动作验证模块,在执行前对 LLM 提出的动作进行授权检查。
Context ManagerDeReAct 中的状态重建与完成认证模块,负责构建环境支持的 State 并判定任务是否真正完成。
Pass@1衡量智能体在单次尝试中成功完成任务的评估指标,常用于 GAIA 和 SWE-bench 等基准。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅