两台机器,一条线的两端

在 2026 人工智能计算大会(AICC 2026)上,浪潮信息发布了两款产品:面向前沿模型运行的元脑 SD200 Ultra 超节点 AI 服务器,和面向大规模推理的元脑 HC2000 多元算力机组。前者要回答「单机能不能装下一个大模型」,后者要回答「同样的钱能产出多少 token」。

SD200 Ultra:把通信时延压下去

  • 以 128 颗国产 AI 芯片紧耦合对称直连,通信时延 0.69 微秒;
  • 单机可运行总参数量 2.8 万亿的 Kimi K3;
  • Token 生成时延降到 5.85 毫秒以内,相当于单用户约 170 tokens/秒,官方称约为业界平均水平的 5 倍;
  • 整机 8TB 带宽、64TB 内存,官方称可支持 10 万亿参数规模的前沿模型单机运行。

这类超节点的思路是把「一群机器互连」变成「一台机器内部互连」:通信时延降一个数量级,长上下文与 MoE 路由带来的全局通信开销就不再是主导项,这也是它敢报单机 2.8 万亿参数的底气。

HC2000:把每块钱的 token 产出抬上去

HC2000 走的是另一条路:DirectCom 2.0 极速架构搭配高密液冷 AI 整机柜(300 千瓦级),再用 MCIS 推理软件栈按负载动态匹配算力。官方给的数字是,在典型 Agent 任务场景下与单一算力构建的推理系统相比,同等 SLO 约束、同等投资可实现 10 倍的 Token 产能提升。注意这两个前提——同等 SLO 与典型 Agent 任务——换成你自己的负载,比例会变。

为什么这次把「时延」单独拿出来说

训练时代看算力总量,智能体时代看「每一步要等多久」。一个工具调用型任务由几十上百步组成,单步延迟从几十毫秒压到几毫秒,累积到任务层面就是可做与不可做的差别;也正因为如此,这一代算力产品普遍开始报 token 时延,而不是只报卡数与算力。

算力采购的比价口径正在从「每卡多少钱」转向「每千次任务调用多少钱」,这一转变会淘汰一批只在峰值算力上好看的方案。