这一周国外的 AI 圈里,几条看起来不相关的消息其实指向同一件事:开放权重的账,开始算得过来了。挑三组数字说。
第一组:三家实验室的推理开销,超过了 OpenAI
在 Vercel 这个平台上,Moonshot、DeepSeek、Z.ai 三家加起来产生的推理花费,已经超过了 OpenAI。
但真正值得看的是「转向背后的转向」:这笔钱不一定进那三家实验室的口袋。实际把模型跑起来、把请求接住的是 Fireworks、Together、Baseten 这些推理服务商和各大云厂商——钱最后落在他们那里。
这件事的含义比「谁超过谁」大得多。开放权重把「模型」和「卖模型」这两件事拆开了:权重一旦放出来,价值链上稀缺的东西就不再是那个文件,而是把文件变成稳定服务的能力。谁有机房、有调度、有推理优化,谁收钱。而模型侧的角色,越来越像上游的原料供应商。
第二组:一个 9B 模型,两天做出来,MacBook 上能免费跑
有人放出了一套完全开放的东西——开放数据、开放模型、开放配方。做法里有两个细节很值得记:
数据是纯合成的,覆盖 10 个类别。 关键的那一步叫对比式数据整理:把事实稍微改一改,造出负样本,逼着模型去分辨细微差别。按他们的说法,这样得到的校准是隐式的,训练数据压根不需要概率标签。
训练是 LoRA 微调,基座是 Qwen3.5-9B。 没有用蒸馏——更强的那个模型只拿来当裁判,不拿它的输出去教学生;也没上强化学习。
结果:同一套评测集上,原始 Qwen 是 66%,微调之后是 90%,他们拿来对照的强基线是 93%。推理 100 毫秒(H100),在 MacBook 上也能免费跑。整个东西是两天里公开做出来的。
作者自己加了一句说明,我觉得这句话该被更多人学:没有标准 benchmark 能衡量这个能力,所以它在别的榜单上很可能明显不如那个强基线,但应该比原始 Qwen 好。
一个开放模型配上「它在什么条件下不适用」的诚实说明,比一个漂亮的分数有用得多。
第三组:开放权重不是更差了,只是以前更贵
一线开发者的观察是:开放权重的质量已经追上来了,而成本低了一个量级。
这两件事连起来会推出一个很多人没注意的结果——推理便宜下来之后,模型就可以跑得更久。
过去限制「让模型多想几轮、多做几次自我检查」的不是能力,是账单。当单次调用的价格降下来,反复检查、多轮工具调用就从奢侈品变成了默认操作,而这条路恰好是解难题最直接的办法。所以「开放权重连最难的数学题也开始解掉了」这句话,和「它便宜」其实是同一句话的两面。
还有一条常被低估:数据不出机器。 自己部署权重配上机密计算,才谈得上真的自己掌控数据边界。用闭源 API,再合规的承诺,数据终究是交到了别人手上。
别急着下结论
两件事得说清楚:
推理便宜不等于训练便宜。 上面那个 9B 是微调,不是从零预训练。能自己微调一个模型,和能自己造一个基座,是两回事。
省钱的是模式,不是每个场景。 高频、可并发、数据敏感的场景,开放权重加自己托管优势最大;长尾、低频、复杂推理的场景,闭源 API 省下的运维精力还是划算的。
一句话
这一轮变化的核心不是「开源打败闭源」,而是价值从模型文件转移到了服务能力上。对做应用的人来说是两件事同时发生:好的权重越来越容易拿到,而把它们稳定跑起来的工程能力,越来越值钱。