先说价格:比上一代同档便宜一半

GPT-6 Sol 的标准价是每百万输入 2 美元、输出 10 美元,缓存输入 0.20 美元、缓存写 2.50 美元;GPT-6 Luna 是输入 0.10 美元、输出 0.50 美元,缓存输入 0.01 美元、缓存写 0.125 美元。对照 GPT-5.6 Sol 的 4 美元输入、20 美元输出(促销价),确实是腰斩。据 VentureBeat 转述,OpenAI 发言人表示这是永久定价而非促销,官方把降价归因于推理效率与缓存机制的改进。

官方定价文档里还有几条细则值得记:单次请求输入超过 272K token 时,整段请求按输入与缓存 2 倍、输出 1.5 倍计价;Batch 与 Flex 按标准价 5 折;Fast 模式按适用费率的 2 倍计费。

评测:这次把分数和成本绑在一起报

  • DeepSWE v1.1(真实代码库上的长程软件工程任务):Sol 在 max 档 68.8%,距 Claude Fable 5 的最高分 69.9%(xhigh 档)差 1.1 个百分点,官方称每任务成本低约 80%;
  • Agents' Last Exam V1(跨 55 个细分行业的长程专业任务):Sol 在 max 档 56.4%,官方称高于 Claude Opus 5 在该评测中的最好成绩、每任务成本低 60%;
  • AutomationBench 1.0.6(跨应用串联的端到端业务流程):Sol 在 xhigh 档 33.2%,每任务约 0.27 美元;
  • OSWorld 2.0 offline(计算机使用):Sol 在 xhigh 档 60.5%,每任务成本约为对照模型的五分之一。

可用范围:先给付费档,Chat 里还没有

发布当天起,两个模型在 ChatGPT Work 与 Codex 中对 Plus、Pro、Business、Enterprise 与 Edu 用户开放;Free 与 Go 用户可以在桌面端使用 Luna。两者都还没进普通 Chat。API 侧对所有开发者开放,模型 id 分别是 gpt-6-sol 与 gpt-6-luna。官方说明 ChatGPT 内会当天逐步推送,看不到属正常。企业工作区需要管理员先启用。

第三方测出来的差异

Artificial Analysis 的 Coding Agent Index 给出两个结果:在 OpenAI 的 Codex 环境里,GPT-6 Sol 在 max 档得 57 分,比 GPT-5.6 Sol(max)高 2 分,Terminal-Bench 4.0 从 37% 升到 43%,每任务 2.99 美元、约为上一代的一半;而 GPT-6 Luna 在 max 档得 41 分,比 GPT-5.6 Luna(max)低 2 分,SWE-Atlas-QnA 从 49% 降到 44%。the-decoder 则指出 OpenAI 这次的榜单选角比较挑——GDPval 与 Terminal-Bench 4.0 这些常驻指标没有出现在发布页里,且 Luna 在 max 档与 Sol 在 xhigh 档结果相近而便宜约 78%,把同门选型变成了新问题。

这次要看的不是谁第一,而是「贵模型的一大部分活,便宜档现在能接」。先按任务拆调用,再按账单验收。