阿里在云栖大会上集中展示了全模态模型布局,涵盖语言、图像、视频、音频、音乐及世界模型等多个方向,并透露Qwen4已投入训练,参数规模瞄准5万亿至10万亿。文章以导演陆川用AI在5天内复原明代历史现场为例,说明视频生成模型对复杂画面的还原准确度已达团队预期的95%以上,AI正从提供素材进入完整创作链路。阿里判断,多模态模型正成为机器感知世界、创造内容并与物理世界互动的中枢,行业评价标准也随之从生成效果转向能否稳定交付、连续工作。这意味着多模态竞争已从单项能力比拼进入真实生产环境的考验阶段。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅