该研究针对不透明非对称刚体在单目短视频中的质心定位问题,提出 STATERA 方法。该方法基于预训练视频骨干网络 V-JEPA,在大部分权重冻结的条件下,仅通过轻量级时序 tubelet 混合器预测逐帧质心热力图与轨迹。为支撑该任务,作者构建了 HiddenMass 基准,包含 5 万条 MuJoCo 轨迹和 63 段经物理标定的真实世界测试序列。实验显示,在仿真中 STATERA-50K-Sigma 将归一化质心误差从 DINOv2 的 41.7% 降至 25.2%。在零样本仿真到现实迁移中,监督信号存在根本性权衡:相位感知目标可能引发双峰预测,相位无关目标则易坍缩至统计上安全的质心。相位感知的 STATERA-50K-Crescent 是唯一持续向真实隐藏偏移移动的方法,虽因单目向量过冲导致绝对欧氏误差略增,但物理捕捉率从 2.6% 提升至 41.0%。结果表明,冻结时序表征有助于将惯性动力学与视觉几何分离,从而估计隐藏物理参数。
| STATERA | 一种利用冻结时间管混合器适配预训练视频骨干网络来估计隐藏质心的模型。 |
| V-JEPA | 一种预训练视频骨干网络,用于提取视频帧的时空特征。 |
| HiddenMass Benchmark | 一个包含模拟和真实世界序列的基准数据集,用于评估隐藏质量估计任务。 |
| Zero-Shot Sim-to-Real | 零样本模拟到现实迁移,指模型在模拟数据上训练后直接应用于真实场景而无需微调。 |
| Center-of-Mass (CoM) | 质心,物体质量集中的假想点,是本文估计的目标物理属性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅