Claude Opus 5.5 与 GPT-6 新模型引发价格战

Simon Willison3 天前

Anthropic 发布了 Claude Opus 5.5,约一小时后,OpenAI 推出了 GPT-6 Sol 和 GPT-6 Luna。再加上前一天出现的 Grok 4.7 与 MiMo v2.6 Flash/Pro,近期大模型市场明显进入了密集更新期。

目前还需要更多时间才能全面评估这些新模型的能力,但从初步信息看,一个显著变化是:价格竞争正在加速。

GPT-6 Sol 与 Luna:价格降到 GPT-5.6 对应模型的一半

GPT-5.6 Luna 此前已经是一个适合应用开发的高性价比模型:性能不错,价格也低。GPT-6 Luna 在此基础上再次降价,约为 GPT-5.6 Luna 的一半。GPT-6 Sol 相比 GPT-5.6 Sol 也有类似幅度的降价。

当前几个模型的价格对比如下:

模型 输入 缓存输入 输出
GPT-6 Luna $0.10/M $0.01/M $0.50/M
GPT-5.6 Luna $0.20/M $0.02/M $1.20/M
Grok 4.7 $2/M $0.50/M $6/M
GPT-6 Sol $2/M $0.20/M $10/M
GPT-5.6 Terra $2/M $0.20/M $12/M
Claude Opus 5.5 $4/M $0.20/M $20/M
GPT-5.6 Sol $4/M $0.40/M $20/M
Claude Fable 5.1 $10/M $0.25/M $50/M
GPT-6 Astra $10/M $1/M $50/M

需要注意的是,GPT-5.6 原本计划在 11 月涨价 25%。因此,GPT-6 的价格并不是只比未来价格低,而是已经低于 GPT-5.6 当前促销价的一半。

在这个定价下,GPT-5.6 Terra 与 GPT-6 Sol 的输入价格相同,但输出价格更高,继续使用 Terra 的理由明显减少。

Grok 4.7 的定价为输入 $2/M、输出 $6/M,曾经相较 GPT-5.6 Sol 便宜许多;但 GPT-6 Sol 发布后,两者输入价格已经相同,输出价格差距也变小。

GPT-6 Luna 的输入 $0.10/M、输出 $0.50/M,是 OpenAI 发布过的低价模型之一。此前更低或接近的包括 GPT-4.1 Nano($0.10/M 输入、$0.40/M 输出,2025 年 4 月)和 GPT-5 Nano($0.05/M 输入、$0.40/M 输出,2025 年 8 月),但这些模型能力更弱。

Claude Opus 5.5 也降价了

Claude Opus 5.5 看起来回应了用户对 Opus 沟通风格的一些批评:它被描述为表达更清晰、每 token 成本低于 Opus 5.0,并具备接近 Fable 5.1 的智能水平,同时 token 使用效率更高。

Claude Opus 4.5、4.6、4.7、4.8 和 5 的价格一直保持一致:输入 $5/M,输出 $25/M。Opus 5.5 则降至输入 $4/M、输出 $20/M,相当于约 20% 的降幅。

更重要的是,缓存读取价格下降了 60%。这对长对话和智能体类任务很关键,因为在这类场景中,90% 以上的输入 token 往往可以按缓存价格计费。

不过,Opus 5.5 的新价格与此前 GPT-5.6 Sol 相同,而 OpenAI 已经将 GPT-6 Sol 的价格降到输入 $2/M、输出 $10/M。

目前最高一档模型中,GPT-6 Astra 与 Claude Fable 5.1 都是输入 $10/M、输出 $50/M。当前价格战更集中在其下一档模型。

Anthropic 表示 Sonnet 5.5 和 Haiku 5.5 即将推出。值得关注的是,Haiku 是否能在低价区间重新获得竞争力。当前 Haiku 4.5 的价格是输入 $1/M、输出 $5/M,而 GPT-6 Luna 已降至输入 $0.10/M、输出 $0.50/M,仅为其十分之一。

Claude Opus 5.5 的 “max” 思考档位出现过度推理问题

在一个“生成一张骑自行车的鹈鹕 SVG”的测试中,Claude Opus 5.5 在 “max” 思考级别下没有成功返回最终结果。

它先将这个请求称为“经典测试请求”,随后开始非常详细地推理 SVG 的构图、鹈鹕喙部、腿部路径、自行车结构、踏板位置、链轮层级等细节。但最终,它在仍然处于推理阶段时触及了 128,000 输出 token 的上限,导致没有生成最终 SVG。

第二次尝试也出现了同样结果。两次失败各花费约 $2.56,并耗时接近 20 分钟。

这说明至少在该测试中,Opus 5.5 的 “max” 档位可能存在过度思考的问题:在一个相对简单的 SVG 任务上都可能耗尽输出预算,那么在更复杂任务中也存在类似风险。

相比之下,Fable 5.1 在 “max” 档位没有出现类似过度推理,并成功生成了效果较好的鹈鹕 SVG。

价格战的实际影响

从目前信息看,这轮更新不仅是模型能力迭代,也明显改变了开发者使用模型时的成本结构:

  • GPT-6 Luna 将低价模型的门槛进一步压低;
  • GPT-6 Sol 直接冲击中高性能模型区间;
  • Claude Opus 5.5 降低了输入、输出和缓存读取成本;
  • 长上下文与智能体任务会尤其受缓存价格影响;
  • 低端模型市场可能继续承压,尤其是 Haiku 这类轻量模型。

作者目前已将 GPT-6 Sol 和 Claude Opus 5.5 作为 Codex 与 Claude Code 中的默认模型,并将一个 Datasette Agent 演示切换到 GPT-6 Luna。初步观察是,GPT-6 Luna 在 SQL 查询以及生成 HTML、JavaScript 方面速度较快,表现也较可靠。

总体来看,新一轮竞争的核心不只是“谁更聪明”,还包括“谁能以更低价格提供足够好的能力”。对开发者而言,这可能比单项基准测试分数更直接影响模型选型。

评论

请登录后发表观点

暂无数据