这篇综述系统梳理了基础模型时代下人类中心智能的发展现状。文章指出,尽管该领域在规模化、可迁移性和通用建模方面取得进展,但尚未与基础模型充分融合,且各研究方向因任务、模态和社区差异而碎片化。为弥合这些鸿沟,作者提出一个涵盖六个相互关联层级的全谱系人类上下文分类框架,将人类分别视为通过视觉外观与空间几何观察的客体、通过运动动力学与交互建模分析的行为者,以及通过世界模拟与具身智能体建模的情境主体。文章进一步梳理了该领域的方法论基础,包括数据体系、计算架构范式及训练推理优化策略,并系统评述了各层级的代表性方法、数据集、基准和评估指标。最后,作者讨论了实现可扩展、可信赖、具物理基础且可部署的人类中心智能所面临的开放挑战与未来方向,为该领域提供了统一框架和实践参考。
| Foundation Models | 大规模预训练模型,如GPT和BERT,能够通过微调适应多种下游任务。 |
| Human-centric Intelligence | 以人为中心的智能,专注于理解和建模人类的外观、行为和环境交互。 |
| Taxonomy | 分类法,用于系统组织和分类概念或实体。 |
| Embodied Agency | 具身代理,指智能体在物理或模拟环境中通过身体交互实现目标。 |
| Kinematic Dynamics | 运动动力学,研究物体运动规律,此处指人类动作的建模。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅