具身智能领域正迎来“上下文学习”(ICL)的新范式,类似GPT-3在NLP中的突破。2026年8月,Skild AI发布S1模型,机器人仅凭一次任务演示视频即可执行未训练的新任务,无需微调,且任务时长可达10分钟;数据显示,在未见任务上,加入视频上下文比纯语言指令性能提升约7倍。同期,Generalist AI的GEN-1.5也支持单次示范学习,实现快速任务泛化。这一趋势源于具身模型需处理每秒数十帧视觉与动作序列的复合上下文,远超LLM的文本复杂度。国内创业公司可可矩阵则创新性地将后训练ICL前置至预训练阶段,旨在解决数据规模扩展瓶颈。尽管技术细节未全公开,但ICL被视为具身智能Scaling的新赛道,核心挑战在于如何高效编码长历史信息并实现快速适应。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅