🔥 今日值得一读 阿里Qwen3.8全模态模型炸场:100万上下文,token消耗直降45.7%!
Alibaba Qwen Releases Qwen3.8-Omni-Flash: A 1M-Context Omni-Modal Model Built Around Agentic Audio-Video Understanding and Tool Use
MarkTechPost 🔥 重点 多模态Agent大模型开源 🕐 09-18 16:40

📖 AI 总结

阿里巴巴通义千问团队发布Qwen3.8-Omni-Flash,称其为首个围绕智能体能力构建的全模态模型。该模型可接收文本、图像、音频和视频输入,输出文本,将音视频理解、推理与工具调用整合于单一模型,工作流程为理解内容、规划任务、调用工具、交付结果。模型基于Qwen3.8-Flash-Next架构,上下文窗口达100万token,最大输入约99.1万、输出13.1万,推理长度上限26.2万token,默认开启思考模式。目前仅通过QwenCloud、阿里云百炼等托管API提供,未开放权重。其突出特点是面向长视频的智能体式感知:从问题出发,经多轮由粗到细的证据收集,将算力集中于关键片段。据官方数据,在OmniVideoBench上准确率由63.4提升至67.8,token消耗从145736降至79117,减少约45.7%。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅