开权重模型这两年的比较维度换过两次:先是从"参数多大"换到"每个 token 激活多少",现在又往"单位任务花多少钱"挪。本月要放出全权重的一个新模型(Beam)把这条线画得挺清楚——501B 总参数,每个 token 只激活 23B,许可是 Apache 2.0。
先给结论:值得记的不是 501B,是那个 23B,还有"快三到四倍"这句话到底在跟谁比。权重还没放出来之前,能做的只有把口径拆开看。
501B 和 23B 是两个账
总参数和激活参数记的不是一回事,混着看容易得出错的结论。
- 总参数决定权重占多少显存。不管这次推理挑中哪几个专家,整份权重都得在机器上装得下。
- 激活参数决定每个 token 实际过多少计算。23B 对 501B 大约是 4.6%,也就是生成一个 token 只走全部参数里的二十分之一。
稀疏专家混合就是干这个的:把参数切成很多份,每个 token 只挑其中几份走。做法本身不新鲜,近两年的开源模型基本都在用,差别在稀疏到什么程度——越稀疏,显存压力和算力压力差得越开。500B 量级配 20B 级激活,属于差得比较开的那一档。
所以要问的不是"它是不是 500B",而是两件事:这份权重你要用多大的机器装下,装下之后每个 token 花掉多少算力。
"快三到四倍"要先问跟谁比
公告里的说法是推理效率比 GLM 5.2 高三到四倍,比同类开权重模型高四倍以上。
这类倍数有三个变量:基线是哪一代、量化到哪一档、以及"效率"指的是吞吐还是单任务耗时。公告挑的基线是 GLM 5.2,这个选择本身没什么问题,但倍数对基线很敏感,换一个参照物数字就会变。
更实际的是,公告给的是相对倍数,没给绝对值:每秒多少 token、首字延迟多少、单卡能扛多少并发,一个都没出现。相对倍数只能说明方向,绝对值才决定你能不能用它替掉现在跑着的东西。
训练侧那组数字比效率倍数更硬
公告里还有一组数字没怎么被讨论:预训练 4 周、24T token;后训练这次强化学习跑了 10.5k 张 GB300,持续 4 周。
24T token 放在 500B 的模型上,说明基础能力是数据堆出来的,不是靠后期补。上万张卡跑四周的强化学习,说明拉开差距的重心已经从预训练挪到后训练——这一步烧的是算力和时间,不是配方。
对使用者来说这两条只说明一件事:它不是靠小规模微调蹭出来的模型,短期内也没人能用低成本复现同一条训练路径。
Apache 2.0 加两档量化格式,说的是能不能自己跑
许可是 Apache 2.0,权重全量放出,同时提供 FP8 和 NVFP4 两种量化数值格式。
许可最容易被跳过,但它决定你能拿它做什么:能不能商用、能不能改、能不能塞进自己机房。Apache 2.0 在这几件事上没有附加条件,属于开权重里比较宽松的一档。
量化格式决定你装不装得下。按 8 位存,501B 的权重大概 500GB 上下;4 位再砍一半,250GB 量级。再加上 KV 缓存和运行时开销,单机多卡是底线,笔记本碰不了这个量级。公告一次给两档格式,等于把部署门槛摆在了台面上。
从看到公告到敢迁任务,中间有五步
- 1等权重真放出来公告、红队进度、许可说明都还不算证据
- 2核对基线看清楚"快几倍"是相对哪一代、哪一档量化
- 3试装一次先确认显存装得下、量化后的掉点能不能接受
- 4用自家任务抽测二三十条真实任务跑一遍,比任何榜单都直接
- 5压一次长链路至少跑一次几小时的连续任务,看中途会不会漂
第二步最省钱,也最常被跳过。
三类人现在该做的事不一样
做选型的:把它放进候选,但别现在改方案。权重没到手,"效率高三倍"就没法验证,等独立评测或者自己抽测出数再说。
做部署的:先算显存账。总参是装机的下限,量化档位决定还能不能再压一档,这两件事跟效率倍数没关系,但它们决定你要准备什么机器。
做评测的:把公告没给的那几个数补上——吞吐、首字延迟、并发下的每 token 成本。相对倍数谁都会发,绝对值才能横向比。
现在能说什么
能说的是:一个 501B 总参、23B 激活、Apache 2.0 许可的开权重模型本月要放出全权重,这个体量放在开源这一档里本身就值得记下来;训练侧的算力投入也明明白白写在那里。
不能说的是:它能不能替掉你现在用的模型。效率倍数是自家口径、基线自选、绝对数值缺失,权重还在红队阶段,下载按钮还没亮。等它落地,先跑第三步和第四步,再决定要不要动。
开权重模型的价值从来不在发布会当天,在权重下载之后的第一批真实任务里。