DeepSeek推出全新多模态模型deepseek-v4-flash-vision-exp,标志着其从纯文本处理向多模态Agent任务执行的关键跨越。该模型在保持V4-Flash文本能力的基础上新增视觉理解功能,支持混合图文输入,并在多模态Agent基准测试中表现接近Opus-4.8等高端模型。定价延续V4-Flash体系,图片按token计费,每张最高换算384 tokens,输入价格低至每百万tokens 0.05元(缓存命中空闲时段),延续低成本API策略。同步上线的Files API支持文件上传后通过file_id重复引用,解决多轮对话中图片复用问题,单个文件最大64 MiB。此次更新聚焦办公、开发、内容生产等实际Agent应用场景,而非单纯视觉娱乐功能,反映出AI Agent正从文字指令处理向理解现实世界信息的基础设施演进。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅