被交给大模型的那个 if
Tomasz Tunguz 的观察很朴素:传统程序里的判断逻辑是刚性的,AI 被用来处理例外。但「如果是香蕉就归到水果」这类判断,并不需要世界上最聪明的模型。他去找自己代码里那些被顺手交给 AI 的 if-then 语句,结果在几分钟内就把其中一个智能体里约四分之一的调用替换掉了。
专用判定器为什么便宜
Jev 由 TypeSafe 在 9 月 15 日发布,返回的是带类型、经过校准的判断,而不是生成文本;SemIf(MIT 许可,9 月 18 日发布)与 kev 是这一接口模式的开源复现。它们的做法是注意力计算只跑一次,再根据少量输出 token 直接算出每个「允许的答案」的概率,因此不需要自回归地把整段文本生成完。
准确率与成本的两个数字
- 准确率:在一批 98 条人工核验过的生产邮件线程上,专用判定器把分类准确率从生产模型的 47% 提升到 80% 以上;
- 成本(单价):Jev 定价每百万输入 token 0.042 美元、输出不计费,官方说明这个价格可能有补贴;对照 Sonnet 级别的 3 美元输入与 15 美元输出;
- 成本(单次):一次典型的 2,000 输入加 60 输出分类调用,约为对照模型的 82 分之一;TypeSafe 自己的流程评测把单次成本记到 0.0004 美元,对照两个前沿模型的 0.0304 与 0.0836 美元,差 76 到 209 倍。
需要注意测试条件:SemIf 的基准数字来自官方公布的结果,运行在 RTX 3090 上、冻结的 Qwen3.5-4B 底座;Jev 的数字包含厂商自评。两边的具体口径不同,作为选型依据时应先在自己的数据上复现。
作者提出的结构判断
文章最后给了一个更大的推论:AI 的成本结构正在分叉——用最大的前沿模型去训练新模型、去设计系统架构,而一旦系统成型、要成千上万次重复执行,就该换成更窄的模型。如果更多编程原语被这样专门化,harness 这一层会拿到更多毛利。
反过来看,这也是对智能体工程的一个提醒:把「需要生成」和「需要判断」分开处理,往往比换一个更强的通用模型更快见效。