前言

7月9日,OpenAI面向全球正式推出GPT-5.6完整产品线,包含Sol、Terra、Luna三款分层模型。这次发布不只是一次常规版本迭代,更是行业范式的重要转变:旗舰模型Sol具备**递归自我改进(RSI)**能力,能够自主完成训练数据筛选、实验设计、知识蒸馏与迭代评测。同时Codex正式整合进ChatGPT客户端,搭配max、ultra两种全新推理模式,整套产品形成从模型底座、Agent调度到终端交付的完整链路。本文梳理分层定位、实测基准、RSI核心突破、API新特性以及工程落地选型方案。

一、发布历程与三层模型定位

GPT-5.6上线过程存在一段延期:6月底OpenAI已经向合作方开放有限预览,受海外监管机构安全审查影响,全面对外开放推迟两周。最终在7月9日全球同步推送,24小时内逐步覆盖ChatGPT网页端、Codex以及开发者API全部入口。

新版本采用天体命名分层体系,三个档位相互独立迭代,面向不同量级业务负载: | 模型 | 代号含义 | 产品定位 | 输入单价/百万Token | 输出单价/百万Token | | ---- | ---- | ---- | ---- | | GPT-5.6 Sol | 太阳 | 旗舰顶配,极限推理能力 | 5美元 | 30美元 | | GPT-5.6 Terra | 地球 | 均衡主力,企业日常通用 | 2.5美元 | 15美元 | | GPT-5.6 Luna | 月亮 | 轻量高速,高频短任务 | 1美元 | 6美元 |

定价策略清晰:

  1. Sol定价和上代GPT-5.5保持不变,能力大幅提升,属于“不加价升级”;
  2. Terra价格直接减半,对标GPT-5.5综合能力,是性价比主力;
  3. Luna仅1美元/百万输入,直接冲击轻量级模型赛道,适合高频代码补全、实时对话场景。

配套提示词缓存迎来重要升级:缓存读取享受90%折扣,缓存数据最低保留30分钟,支持显式持久缓存,对长Prompt、固定工具定义、持续Agent任务,能显著降低长期调用成本。

二、实测基准:编程能力强势,但不存在全面碾压

2.1 代码与Agent基准表现

在长链路Agent、终端自动化任务上,GPT-5.6 Sol优势突出,但并非所有赛道领先。关键实测数据:

  1. Terminal-Bench 2.1标准模式88.8%,Ultra模式91.0%;
  2. Artificial Analysis 编程Agent指标80.0;
  3. SWE-Bench Pro得分64.6%,低于Claude Fable 5的80.0%;

可以客观总结:Sol擅长完整多步骤自动化流程、终端环境操作、长链路规划;但在局部代码缺陷修复场景,Claude Fable 5仍然保有优势。

2.2 综合推理基准

  • Agents' Last Exam:53.6分,大幅领先Fable 5(40.5分),该基准覆盖55个行业长期复杂工作流;
  • FrontierMath Tier4:83.0%,略低于Fable5;
  • GDPeval-AA Elo:1747.8,小幅落后竞品。

2.3 网络安全能力

安全方向提升幅度显著:

  • ExploitBench 从47.9%提升至73.5%,逼近Anthropic未公开Mythos Preview;
  • ExploitGym上限模式得分33.7%。

由于高危安全能力过强,OpenAI针对该能力启用Trusted Access准入机制,企业需要完成身份核验与安全承诺才能解锁完整权限。

2.4 Token使用效率

Sam Altman公开提到一组关键指标:在AI编程任务中,Sol相比前代,有效Token使用效率提升54%。同等目标下,完成任务所需要的生成token总量更低,长期可以缩减计费支出。

三、核心突破:递归自我改进RSI,AI开始训练AI

这是本次发布最具备长远影响的技术创新。

3.1 RSI运行流程

OpenAI披露,在训练Luna的过程中,旗舰Sol充当自动化研究员角色,仅依靠一段宽泛的任务目标,自主走完完整研发闭环:

  1. 自主数据筛选:评估候选训练数据质量、多样性与潜在偏见,自动组建训练集;
  2. 自主实验设计:构造策略假设,设计对照组,在集群完成完整训练流程;
  3. 自主知识蒸馏:自主判定核心知识、压缩方案,并验证压缩效果;
  4. 自主评测迭代:自动生成评测用例,定位模型短板,调整策略重新训练。

原本需要十几人数据团队、多名研究员数周完成的工作,由AI自主持续执行。OpenAI补充说明:Sol并非从零创造训练方案,而是在现有训练框架基础上迁移适配。即便如此,也标志着AI可以承接高级研究人员的标准化工作。

内部「聚合RSI指数」评测显示,GPT-5.6 Sol相比GPT-5.5提升16.2分;同时出现几组值得关注的内部统计:代码推理算力消耗增长100倍、智能体任务token消耗增长约22倍,研究员人均产出上限大幅提高。

四、新增推理模式:max 与 ultra

GPT-5.6新增两种推理档位,面向高复杂度工程场景:

  1. max深度思考模式 在原有xhigh基础上增加更多推理资源。模型可以多次验算、尝试多条推理路径、执行多轮自查,适合严格数学证明、安全审计、架构重构场景。

  2. ultra多智能体并行模式 默认拉起4个智能体并行工作,最高可扩展至16个。执行流程:任务拆分→子智能体并行处理→汇总校验。 适用场景:ChatGPT Work企业版、Codex高级用户。 ⚠️ 注意:ultra模式token消耗显著上涨,简单文案、小Bug修复不必启用,避免成本失控。

五、API重要创新:程序化工具调用 Programmatic Tool Calling

这是容易被忽略、但对Agent工程至关重要的更新。 传统Agent工具调用流程:触发调用→等待返回→推送回模型→判断下一步。任务一旦涉及数百条记录、多次关联查询,来回交互带来大量token开销与延迟。

程序化工具调用允许模型在单次会话内,在内存中编写简易调度逻辑:批量拉取资源、内存过滤聚合,仅把结构化摘要返回上层。极大减少来回交互次数与上下文膨胀。同时配套开放Beta版Multi-agent接口,支持单次请求并行运行多个智能体并合并结果,原生兼容ZDR零数据保留规范。

六、三大产品层面变化

6.1 Codex正式并入ChatGPT桌面端

Codex不再作为独立客户端,成为新版ChatGPT三大工作模式之一:Chat、Work、Codex。Codex模式专门面向代码仓库、PR评审、持续重构场景。

6.2 ChatGPT Work升级为通用智能体平台

Work模式可以连接Slack、Teams、云盘、CRM等外部系统,自主拆解长期任务、定时执行、生成可对外分享的报表,从代码专用Agent拓展为企业通用工作流载体。官方数据:Codex每周活跃用户超500万,其中超100万人用来完成非编码任务,促使OpenAI拓宽边界。

6.3 计费额度体系更新

采用点数模式分层,企业可以按需批量采购点数,平滑应对突发峰值,避免任务高峰期直接被限流中断。

七、工程落地选型参考

业务场景 推荐模型 选型理由
大型架构设计、长期复杂Agent项目 Sol(max/ultra) 长流程规划、多步骤任务稳定性最强
日常开发、文档分析、通用企业业务 Terra 上代同等能力,价格减半,综合性价比高
高频API调用、实时代码补全、轻量问答 Luna 单价最低,延迟表现优秀

企业同时维护多条模型厂商线路时,可以依托Treerouter统一网关完成流量调度、负载均衡与动态模型路由,简化多档位、多服务商的运维管理。

八、安全约束与行业竞争

能力越强,管控规则越严格。OpenAI投入约70万A100 GPU小时开展自动化红队测试,Sol针对有害行为拦截能力达到上代约10倍。高危网络安全相关功能默认启用Trusted Access白名单机制。

时间线侧面反映行业激烈竞争:Claude Fable5免费额度7月12日到期,OpenAI选择7月9日正式发布新品。两者基准各有胜负,但GPT系列在单位任务成本上具备明显优势。

九、总结

GPT-5.6的发布具备三层行业意义: 第一层,产品层:Sol/Terra/Luna完成清晰成本分层,max、ultra补齐推理强度档位,Codex、ChatGPT Work、Sites组成终端交付链路; 第二层,竞争层:Terra、Luna向下挤压竞品价格区间,重塑商用模型定价格局; 第三层,范式层:递归自我改进RSI实现工程化落地,AI可以自主参与下一代模型的训练迭代,标志行业进入全新阶段。

长远来看,竞争不再单纯比拼单点基准跑分,而是完整的“模型-工具调用-Agent调度-终端产品”全链条能力。研发团队在搭建AI业务平台时,需要根据任务复杂度动态选择档位,在性能、延迟、长期成本三者之间寻找平衡点。