Black Forest Labs发布了FLUX 3 Action,一个70亿参数的开源权重世界动作模型,专用于机器人控制。该模型能够同时读取摄像头画面、机器人状态和文本指令,并联合预测未来视频帧与动作序列。在RoboLab-120基准测试中,它以42.92%的任务成功率排名第一,超越了NVIDIA Cosmos 3 Nano的36.8%和VLA模型π0.5的28.0%。其核心突破在于通过更小的骨干网络和蒸馏技术,在保留视频与动作联合预测能力的同时缩小了与快速VLA模型之间的速度差距。模型基于多模态FLUX 3骨干,预训练数据中视频占比超过95%,中期训练混合了预训练数据与动作对齐视频,覆盖14种具身形态。预训练对性能影响显著:无预训练时DROID数据训练成功率不足1%,加入预训练后提升至11.6%。部署方面,DROID策略在BF16下需约32GB显存,经FP8量化后可适配24GB显卡,许可证限制为非商业用途。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅