发生了什么

9 月 10 日,DeepSeek V4.1 Flash 上线国家超算互联网中心。用户登录国家超算互联网官网,从首页进入「模型服务」页面,即可打开 DeepSeek V4.1 Flash 的 API 调用界面。这是该模型在 DeepSeek 自有渠道之外,新增的一条国家级算力平台调用入口。

规格:552B MoE,输入输出不对称

  • 总参数 552B 的 MoE 模型,采用全新的 Causal-Encoder-Decoder 结构,输入与输出不对称:输入激活只有 8B,输出激活 16B
  • 官方称采用新的预训练方式、经过更大规模强化学习后训练,基准测试中智能水平超过包括 DeepSeek V4 Pro 在内的一众旗舰模型
  • KV Cache 大幅压缩:与上一代模型相比,对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/8

为什么 KV Cache 比跑分更值得看

DeepSeek 自己的说法是:Agent 使用场景中缓存命中费用占比往往很高,对 KV Cache 的压缩能大幅降低 Agent 类任务的使用成本。这句话的信息量大于榜单——多轮工具调用、长系统提示词、反复读取同一批上下文的负载,成本大头在缓存而不在首次推理;显存需求降到 1/4 也意味着同样的机器能承载更长的上下文或更高的并发。

接入前先确认三件事

  • 负载形态:单轮短问答几乎吃不到 KV Cache 收益,长上下文与多轮 Agent 负载才明显
  • 账单口径:同一批请求分别跑缓存命中与未命中两条路径,算单任务成本,别只看每百万 tokens 单价
  • 调用渠道:国家级平台的配额、备案与结算另有流程,接入前把数据与合规要求问清楚

需要留意的边界:552B 参数与「全面超越 V4 Pro」均为官方口径,第三方独立评测尚未跟进;缓存压缩带来的实际收益也高度依赖具体负载的上下文复用率,官方未公布分场景的量化数据。

对 Agent 应用来说,缓存命中价和显存占用比综合跑分更接近真实成本。