该研究通过对比人类感知、猕猴下颞叶皮层神经活动与多种图像及视频神经网络模型,探讨视觉系统如何整合物体外观与运动信息并保持鲁棒性。研究发现,时间整合虽能改善物体表征,但多数视频识别模型在外观被破坏而运动结构保留时泛化能力显著下降,而人类和猕猴则保持稳定。预测性世界模型在跨外观泛化上表现最佳,且与猕猴IT区神经活动最为接近,但在神经保真度上仍优于其他视频建模方法。然而,没有任何模型能完全复现皮层从早期外观主导反应向后期外观不变运动编码的渐进转变。这些结果揭示了将运动渐进整合进物体表征是鲁棒动态视觉的关键原则,并表明预测性学习是人工系统实现该计算的有前景路径。
| 鲁棒性 | 系统在输入变化或干扰下仍能保持性能稳定的能力。 |
| 下颞叶皮层 | 灵长类大脑中负责物体识别的高级视觉区域。 |
| 预测性世界模型 | 一种通过预测未来状态来学习环境动态的神经网络模型。 |
| 光流处理 | 计算图像序列中物体运动模式的技术。 |
| 神经保真度 | 模型表征与大脑神经活动之间的相似程度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅