NVIDIA releases open-source model Nemotron 3 Super›

GPT-5.6 正式发布:Sol / Terra / Luna 三档家族,用更少 Token 刷新编程与知识工作

GPT-5.6 · Sol · Terra · LunaReading time: 6分钟Published: 2026.07.10
GPT-5.6 正式发布:Sol / Terra / Luna 三档家族,用更少 Token 刷新编程与知识工作

GPT-5.6 正式发布:Sol / Terra / Luna 三档家族,用更少 Token 刷新编程与知识工作

本站为独立第三方技术服务平台,提供多模型 API 聚合接入服务,与 Anthropic、OpenAI、Google 等模型提供商无任何关联、授权或合作关系。

OpenAI 在 2026 年 7 月 9 日结束限量预览,把 GPT-5.6 家族推到全量可用(GA),覆盖 ChatGPT、Codex 和 OpenAI API,全球分批放量、24 小时内铺满。这次不是单发一个模型,而是一代三档,还顺手改了命名规则。对天天调 API 的团队来说,值得花几分钟看清楚变化和怎么选。

核心要点

  • 一代三档:旗舰 Sol、日常均衡档 Terra(性能对标上一代 GPT-5.5)、最快最省的 Luna。
  • 命名换逻辑:数字(5.6)代表「代」,Sol / Terra / Luna 是长期沿用的能力档位名,各档可按自己的节奏迭代。
  • 两个新推理模式:max(比 xhigh 给更多思考时间)与 ultra(默认并行协调 4 个子代理,部分场景可扩到 16 个)。
  • 主打「每个 Token 更值钱」:官方强调同样预算做更多活,或同样效果花更少钱。
  • 编程刷新 SOTA:Coding Agent Index(max)拿到 80 分;Terminal-Bench 2.1 标准 88.8%、ultra 91.9%。
  • 定价公布(每百万 Token,输入/输出):Sol $5 / $30、Terra $2.5 / $15、Luna $1 / $6。
  • 缓存更可控:支持显式缓存断点,最短缓存存活 30 分钟。

详细解读

命名:数字管「代」,名字管「档」

过去版本号越堆越长,选型很费脑。GPT-5.6 换了思路——数字标代际,Sol / Terra / Luna 标能力层级,而且这三个名字会长期沿用:

  • Sol:新旗舰,编程、知识工作、安全、科学全线拉满。Chat 里 Plus/Pro/Business/Enterprise 可用,Pro/Enterprise 还能选质量更高的 Sol Pro。
  • Terra:均衡档,性能对标上一代 GPT-5.5,但成本更低。Codex/ChatGPT Work 的 Free/Go 用户默认就是它。
  • Luna:最快、最便宜,适合高并发、延迟敏感的轻量场景。

心智成本明显下降:以后你只要认「Sol=当代旗舰、Terra=性价比、Luna=极速」即可。

max 与 ultra:两种「多想一会儿」

这一代最值得关注的是两个新推理模式,思路完全不同:

  • max:给单条推理链比 xhigh 更多的时间去推理、探索备选方案、自查并修正。适合「一步错步步错」的硬核题。
  • ultra:更激进——默认并行协调 4 个子代理,用更高的 Token 消耗换更强结果和更短的完成时间;在 BrowseComp、SEC-Bench Pro 等评测里还测了 16 个子代理的配置。官方数据显示,加并行子代理能把「分数—延迟」曲线整体往「更高分、更快」的方向推。Terminal-Bench 2.1 从标准的 88.8% 提到 ultra 的 91.9%,就是这套架构的功劳。

API 侧对应的是 Responses API 里的 Multi-agent(beta)——一次请求内跑并发子代理并合并结果;以及 Programmatic Tool Calling——模型自己写并运行程序去协调工具、过滤中间结果,减少 Token 和往返次数,且兼容零数据保留(ZDR)。

Benchmark:编程、知识工作、安全全线走强

摘几组官方公布的数字(均以 OpenAI 发布说明为准):

  • 编程:Artificial Analysis Coding Agent Index,Sol(max)拿到 80 的 SOTA;Terminal-Bench 2.1 Sol 88.8% / ultra 91.9%;DeepSWE、SWE-Bench Pro 同步走高。

  • 长程 Agent 工作:Agents' Last Exam(覆盖 55 个专业领域的长流程任务),Sol 创下 53.6 新高。

  • 知识工作 / 电脑操作:BrowseComp Sol 90.4% / ultra 92.2%(SOTA);OSWorld 2.0 达 62.6%。

  • 安全:ExploitBench 从上一代 47.9% 提到 73.5%;SEC-Bench Pro 71.2%;ExploitGym 在时限内峰值 33.7%。

  • 科学 / 健康:GeneBench Pro、LifeSciBench、HealthBench Professional 等均较上一代有提升。

⚠️ 一句实话:benchmark 是厂商在自选口径下跑出来的,横向对比时口径未必完全一致。任何单一分数都别全信,以你自己业务场景的实测为准——这恰恰是多模型平台的价值:同一套代码换 model 就能横向比。

设计与知识工作:从「生成」到「自检交付」

除了跑分,这代主打「更像能交付的协作者」。它的电脑操作能力更强,能检查并打磨已渲染的结果(不只是生成代码/内容),在交回前发现视觉和功能问题、做收尾。知识工作上,它能把 Slack、Notion、Microsoft 365、Google Drive 里零散的上下文,整理成可直接分享的演示、文档和表格,尤其擅长「照着模板/参考稿复现设计系统」。

对开发者意味着什么

  1. 选型更简单:认准三档,按任务复杂度和预算三选一。
  2. 成本结构可优化:把大规模、重复性 Agent 任务下沉到 Terra / Luna,硬核任务留给 Sol + max/ultra,整体开销更可控。官方公布的定价(每百万 Token)为 Sol $5/$30、Terra $2.5/$15、Luna $1/$6,可据此估算不同档位的成本区间。
  3. 缓存能省钱:显式缓存断点 + 30 分钟最短缓存存活,长上下文、重复前缀场景值得利用;注意缓存写入按 1.25× 未缓存输入价计费,缓存读取仍享较大折扣。
  4. 别锁死单一模型:Sol 编程强,但不同模型在架构判断、规划品味上各有所长。稳妥做法是保留横向切换的能力,用真实任务投票,而不是信榜单。

在 Code0 上如何使用

GPT-5.6 是 OpenAI 侧的新模型。Code0 作为多模型聚合网关,测试通过后会第一时间跟进上架,具体可用的 Model ID 与状态以 console.code0.ai 控制台通知为准。

Code0 的核心是 OpenAI SDK 零改造兼容——现有代码基本只改一行 base_url,就能用同一个 Key 在 300+ 模型之间切换。上架后调用大致是这样(model 换成控制台标注的对应 ID 即可):

from openai import OpenAI

client = OpenAI(
    base_url="https://hk.code0.ai/v1",
    api_key="sk-你的Key",  # 在 console.code0.ai 获取
)

resp = client.chat.completions.create(
    model="gpt-5.6-sol",  # 以控制台标注的 Model ID 为准;也可换 gpt-5.6-terra / claude-opus-4-8 / gemini-3-pro / deepseek-v3
    messages=[{"role": "user", "content": "帮我评审这段代码"}],
)
print(resp.choices[0].message.content)

想做「同题横向对比」也很简单——保持 messages 不变,循环换 model 字段即可,一个 Key 就能把 GPT-5.6 三档和 Claude、Gemini、DeepSeek 各跑一遍,用数据决定谁更适合你的场景:

for model in ["gpt-5.6-sol", "gpt-5.6-terra", "gpt-5.6-luna", "claude-opus-4-8"]:
    resp = client.chat.completions.create(
        model=model,  # Model ID 以控制台为准
        messages=[{"role": "user", "content": "同一道题"}],
    )
    print(model, "→", resp.choices[0].message.content[:80])

Code0 侧的计费与可用模型清单以 console.code0.ai 控制台为准,失败请求不计费,按量即用。

总结

GPT-5.6 把「一代三档 + 两种推理模式」摆上了台面:能力上编程、知识工作和安全是明牌强项,思路上更强调「每个 Token 更值钱」而非单纯堆分。对开发者来说,真正的红利不在某个 benchmark 数字,而在按任务分档、按预算切换的自由度。与其押注一个模型,不如保留横向对比的能力——用你自己的业务数据说话。