先看一件事:这次发布的真正新信息,是「谁先拿到」,而不是「分数多高」。过去几代前沿模型基本都是先给开发者和付费用户,这次 Google 把最强的一版先发给了一批受信任的网络安全防守方,并让 Argon 参与美国政府的预发布模型访问流程。这个顺序说明前沿模型正在从「发布」变成「分圈层放行」。
分数:赢在企业场景,输在长程终端任务
18 项基准里 12 项独占第一,但把项目拆开看会更清楚:领先幅度最大的一组全部落在企业工作流上——Harvey 法律 Agent 基准做到 19.6%,而 Astra 是 5.4%、Opus 5.5 是 3.8%;Zapier 的 AutomationBench 做到 51.3%,两家对手都在 42% 上下;金融 Agent 的 Vals v2 是 65.4%,对手在 53% 到 58% 之间。另一方面,长程终端任务上它落后得也很明确:FrontierSWE v2 与 Terminal-Bench Science 0.1 都差 Astra 10.5 个百分点。
- 强在:法律与金融知识工作、自动化流程、长上下文图遍历、长视频理解
- 弱在:长程终端任务(FrontierSWE v2、Terminal-Bench Science 0.1、Terminal-bench 4.0)
- 要留意:18 项基准由发布方自己选定,缺少第三方在同一批任务上的复核
价格与规格:便宜在缓存,贵在拿不到
入门价 $2 / $10 每百万输入 / 输出 token;缓存命中输入按输入价打 95% 折扣,也就是 $0.10;单次输出上限从 64K 提到 100 万 token。对跑长流程 agent 的团队来说,最有价值的是缓存那一项——多轮工具调用里重复的上下文占大头,这一项直接决定账单结构。但这些都要等它真的普遍可用之后才算数。
排行榜第一和「明天能用上」是两件事;在它进入你的采购清单之前,Fairwind 的准入条件才是真正的时间表。
要不要现在动?
如果你的任务集中在长程代码重构、法律与金融文档处理、企业自动化流程,Argon 值得进观察名单;如果你的项目今天就要上线、或者成本极敏感,那就先不动——这一版的领先还没有便宜到能覆盖迁移与验证的成本。有一件事现在就能做:把「按最终产出来算成本」这件事先做扎实,等它开放时你才知道该拿哪个数与现有模型对比。