VeriPhy 是一个面向视频生成世界模型的物理验证系统,旨在解决生成视频“视觉流畅但物理不可靠”的问题。该系统采用文本规划器,在观察任何帧之前将提示编译为类型化物理义务和静态验证的执行计划;执行过程中,观察结果仅门控和限定对冻结的低层专家模型的调用,每个动作返回带来源的证据记录,并通过类型化解析器映射为支持、矛盾或未知的三值状态,确保每个判定都可追溯。评估基于包含1500个视频片段的人工标注缺陷语料库,在149个核心片段上的304条缺陷记录中,VeriPhy 成功解释228条,优于已发表的问题分解评估器的164条。虽然其召回率与整体提示基线(222条)相近,但其核心优势在于每个决策都保留证据记录和来源,使追踪可逐条审计,并可作为将批评性判定写回生成过程的接口。
| VeriPhy | 一个用于世界模型评估与改进的可审计物理验证系统,通过类型化约束和证据记录来验证生成视频的物理合理性。 |
| physical obligations | 物理约束,指将提示编译为具体、类型化的物理规则或要求,用于验证视频内容是否符合物理定律。 |
| provenance-carrying evidence record | 携带来源的证据记录,指包含数据来源和生成过程信息的记录,使每个判定结果可追溯。 |
| three-valued state | 三值状态,指将验证结果分为支持、矛盾或未知三种状态,分别对应合理、不合理或弃权。 |
| question-decomposition evaluator | 问题分解评估器,一种将复杂问题拆分为子问题并逐一评估的方法,用于比较VeriPhy的性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅