阿里巴巴通义千问团队发布Qwen3.8-Omni-Flash,称其为首个围绕智能体能力构建的全模态模型。该模型可接收文本、图像、音频和视频输入,输出文本,将音视频理解、推理与工具调用整合于单一模型,工作流程为理解内容、规划任务、调用工具、交付结果。模型基于Qwen3.8-Flash-Next架构,上下文窗口达100万token,最大输入约99.1万、输出13.1万,推理长度上限26.2万token,默认开启思考模式。目前仅通过QwenCloud、阿里云百炼等托管API提供,未开放权重。其突出特点是面向长视频的智能体式感知:从问题出发,经多轮由粗到细的证据收集,将算力集中于关键片段。据官方数据,在OmniVideoBench上准确率由63.4提升至67.8,token消耗从145736降至79117,减少约45.7%。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅