🔥 今日值得一读 智能体编码新突破:Humanize用72道机械门让缺陷无处可藏,108天狂揽1468星!
Humanize: Judgement Engineering for Agentic Coding
arXiv AI (cs.AI) 🔥 重点 Agent论文方法大模型 🕐 今天 12:00

📖 AI 总结

本文提出 Humanize,一种面向智能体编程的多智能体编排工作流,核心思路是"判断工程":在规划、实现、审查与学习各环节的边界上设置显式且机械强制的决策点。流程由人类批准计划契约,构建智能体分轮实现,来自另一厂商的审查智能体判定是否完成,角色间调度由确定性钩子而非模型负责,共执行72道机械门禁。作者将其视为仓库状态上的马尔可夫链,构建与审查交替采样两个模型,缺陷只有在双方都漏检时才会存留。研究基于实际部署、118份真实循环复盘及应用案例:108天内迭代68个版本,获1468个GitHub星标;应用于567文件的gem5构建系统迁移、在MLSys 2026 FlashInfer竞赛三个全智能体赛道均入前三,并在IOI、IMO、IPhO等竞赛中取得满分或金牌级成绩,PutnamBench达672/672。复盘显示独立审查能识别构建者的无据声明,但"何时停止"仍是主要弱点,约三分之二的轮次发生在实现被接受之后。作者强调这些证据属观察性,并非受控对比。

🔑 关键词速览

Agentic Coding智能体编码,指由 AI 智能体自主完成代码生成、修改和调试等任务的开发范式。
Judgement Engineering判断工程,指在智能体工作流的关键边界上设计显式、可机械执行的决策规则,以确保任务可靠完成。
Multi-agent Orchestration多智能体编排,指协调多个具有不同角色或能力的智能体协同完成复杂任务的工作流设计。
Markov Chain马尔可夫链,一种描述状态转移的随机过程,此处用于建模仓库状态在构建者与审查者交替作用下的演化。
Postmortem事后分析,对已完成任务或事件进行回顾性分析,以总结经验教训并识别改进点。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅