本文提出了一项面向"后训练即服务"(PTaaS)场景的交付基准,将大模型智能体置于前向部署工程师(FDE)的角色,考察其能否在预算、人工审批和可复现性约束下,完成从数据到微调、评估与部署的端到端交付。研究在受治理的交付平面上设置十个阶段,由预言机依据平台记录的事实逐阶段打分,并识别出一类核心隐性失败——"训练了却没学到"(TBDL):损失下降、各项信号正常,但交付模型并不优于基座。作者设计了运营方验收门与基于已知损坏运行校准的检测器,分别用于付款前拦截此类失败和运行中标记严重损坏。实验在L40S、A100、H200等计费GPU上,针对8B至70B开源基座,对四款前沿智能体(Claude Opus 5、GPT-5.6-luna、Gemini 3.7 Flash、DeepSeek V4-Pro)进行了端到端测试,并在同一预言机下与人类FDE对照。该工作将评估焦点从"能否提升指标"转向"能否被信任完成交付",为智能体承担实际工程交付提供了可审计的衡量框架。
| PTaaS (Post-training as a Service) | 将模型后训练(微调、评估、部署)作为一项外包服务交付给客户的商业模式。 |
| FDE (Forward-Deployed Engineer) | 前线部署工程师,直接驻场对接客户需求、负责把模型落地交付的工程角色。 |
| TBDL (Trains But Doesn't Learn) | 指训练过程看似正常(损失下降、指标全绿)但交付模型相比基座毫无提升的隐性失败模式。 |
| Acceptance Gate | 由运营方设置的验收关卡,在付款前自动拦截未真正学到东西的交付运行。 |
| Oracle | 依据平台记录的事实对智能体各阶段表现进行客观评分的权威评分器。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅