阿里巴巴发布了视频生成模型 Wan3.0 的测试版,支持从文本、图片、PDF、网页和PPT等多种输入源生成最长30秒的视频,视频长度较前代 Wan2.5 翻倍。该模型能同时处理文本、图像、视频和音频,单次提示可包含多达10张图片、5段视频和5段音频,旨在减少AI视频中常见的面部和界面视觉漂移问题,保持角色、道具和空间布局的一致性。Wan3.0 通过 wan.video 网站、阿里云 Model Studio 和 Qwen Cloud API 提供,分为标准版和快速版,价格按分辨率和时长计费。阿里巴巴将其定位为适用于影视制作、短视频创作、营销培训及自动驾驶和机器人训练模拟等多种场景,此次发布正值公司加大AI投资之际,尽管近期季度利润因高额投入同比下降75%。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅