Deepseek发布了实验性多模态模型V4-Flash-Vision-Exp,在文本能力基础上新增图像理解功能。据公司内部基准测试,该模型在智能体任务上几乎与Opus 4.8持平,有时甚至超越。模型定位面向视觉智能体工作流,支持图像描述、截图文本提取和图表分析,兼容JPEG、PNG、GIF和WebP格式,并能根据文件内容而非文件名识别格式。它适配OpenAI和Anthropic的API,并配套更新了Harness框架。定价沿用V4-Flash标准,单次请求最多处理600张图像,每张图像成本上限384个token,并提供Files API供开发者重复引用上传文件。该发布凸显中国AI在视觉智能体领域的快速追赶,对西方模型构成竞争压力。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅