OpenAI 推出 GPT-5.6:Sol、Terra、Luna 与 Codex 超级应用路线
Latent Space17 天前
OpenAI 发布 GPT-5.6 三个新版本
OpenAI 推出 GPT-5.6 系列,包含三个新尺寸:Sol、Terra 和 Luna。这三个名称分别对应太阳、地球和月球的尺度,用于区分模型能力层级。
此次更新还引入了新的 ultra effort level。OpenAI 将其描述为最高能力设置,面向复杂任务时会协调多个智能体并行工作,以更快完成任务。
其中:
max会给予 GPT-5.6 比xhigh更多推理时间,用于探索替代方案、执行检查并修正方法。ultra进一步默认协调 4 个智能体并行,以更高 token 消耗换取更强结果和更短的复杂任务完成时间。
基准测试与成本表现
文章称,在多个基准测试中,GPT-5.6 相比 Fable 或 Opus 具备更高性能和更低成本。
其中提到:
Terra 的表现略高于 Fable 5,Luna 超过 Opus 4.8;两者大约只需三分之一的时间、约一半输出 token,并且估算成本约为四分之一。
GPT-5.6 还被称为在 Terminal-Bench 2.1 和 DeepSWE 上取得新的最佳结果。这两个测试分别关注复杂命令行工作流,以及真实代码库中的长周期工程任务。
不易量化但值得关注的能力
除可量化基准外,文章还提到 GPT-5.6 在以下方面有改进:
- 计算机使用能力
- 演示文稿与文档生成
- 科学研究相关任务
这些能力较难通过单一 benchmark 完整衡量,但作者认为仍应认真看待。
ChatGPT Work 与 Codex 桌面更新
OpenAI 同时推出 ChatGPT Work,并更新了 Codex 桌面应用。
文章认为,这可能是 OpenAI “超级应用”策略接近完成前的关键一步。当前仍未明确的问题,是其智能体浏览器后续会如何整合进这一体系。
从现有信息看,OpenAI 正在把模型能力、工作场景、代码能力和桌面端使用体验进一步合并,推动 ChatGPT 与 Codex 从单点工具向更完整的工作入口演进。
