DeepSeek 发布新模型 V4.1-Flash,核心目标是大幅降低长文本处理与智能体运行的部署成本。该模型拥有 5520 亿参数,支持高达 100 万 token 的上下文,通过将语言主干拆分为编码器与解码器两部分,读取输入时每 token 仅激活 80 亿参数,生成文本时激活 160 亿参数,从而将输入侧算力需求近乎减半。其最大突破在于显存占用:快速 GPU 内存中的 KV 缓存仅需前代 V4-Flash 约四分之一空间,永久卸载部分缩减至约八分之一,相比 V1 每 token 全局缓存体积下降 437 倍。模型基于 45 万亿 token 的文本与图像数据从头训练,在编程任务上可媲美 OpenAI 和 Anthropic 的顶级闭源模型,但在复杂科学任务和图像分析方面仍存在短板。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅