暂无菜单项

OpenAI公布GPT-5.6自进化秘籍!

发布于
3
OpenAI 与 GPT-5.6 Sol 近期技术动态
OpenAI 与 GPT-5.6 Sol 近期技术动态

OpenAI 在短时间内释放了多条技术和业务信息:GPT-5.6 Sol 开始参与优化承载自身运行的推理系统,生产 GPU 内核改进使端到端服务成本下降 20%,推测解码升级让 Token 生成效率提升超过 15%;与此同时,智能体 Harness 对长任务表现的影响,也在 ARC-AGI-3 上被进一步量化。

想了解 Codex 的能力与使用入口,可查看做视频网收录的 Codex 站内详情页

其他消息还包括 OpenAI 硬件研发、用户规模与人才流动。OpenAI 官方工程文章称,其产品已经服务约 10 亿活跃用户和超过 200 万家企业。格雷格·布罗克曼确认公司正在探索新的 AI 硬件交互,但设备形态、发布时间和规格仍未正式公布。

信息核验:翁荔(Lilian Weng)离开 Thinking Machines Lab 后“将回归 OpenAI”目前属于媒体传闻。截至本文整理时,OpenAI 与翁荔本人尚未公开确认新任职信息,因此不能把“回归”写成既定事实。

一、GPT-5.6 Sol 如何把服务成本压低 20%

GPT-5.6 Sol 优化生产系统后的服务成本与生成效率数据
GPT-5.6 Sol 优化生产系统后的服务成本与生成效率数据

模型完成训练后,每次回答仍要经过请求路由、任务调度、GPU 内核、缓存管理和模型前向计算。任何一个环节出现负载不均、显存搬运过多或数据布局低效,都会让 GPU 空转。GPT-5.6 Sol 在 Codex 中分析真实生产流量、寻找此前被忽视的不平衡,并测试新的路由与配置策略。

在底层计算部分,GPT-5.6 Sol 使用 Triton 与 Gluon 重写并优化生产 GPU 内核,寻找可以预计算、避免或并行的工作。OpenAI 表示,这些改动与更广泛的内核优化共同作用,使端到端服务成本下降 20%。这是其生产系统的整体结果,不等于所有第三方部署都能直接复现相同幅度。

推测解码让 Token 效率提升超过 15%

推测解码让更小的草稿模型先提出多个候选 Token,再由主模型并行校验。候选被接受时,一次主模型前向计算可以产出多个 Token,从而减少昂贵的串行生成步骤。GPT-5.6 Sol 围绕草稿模型的规模、结构与特征执行了数百组实验,还负责启动和监控训练,在硬件故障或训练不稳定时介入处理。

GPT-5.6 从智能体编排到 GPU 推理的全栈效率优化
GPT-5.6 从智能体编排到 GPU 推理的全栈效率优化

进一步的优化来自批处理、分片、KV Cache 和负载配置。提示词长度、输出长度、缓存命中率与请求类型不同,最优服务参数也不同。模型可以根据真实业务负载生成候选配置并批量评估,让过去依赖经验的粗粒度规则变成场景化调优。

这里的“自进化”更准确地说是受控的系统级自我优化。GPT-5.6 Sol 优化了承载模型的代码、草稿模型和服务参数,并没有直接修改自己的核心主模型权重;目标、权限、验证与部署仍由工程体系控制。

二、智能体效率不只取决于模型速度

一次用户任务包含多轮模型调用与工具调用
一次用户任务包含多轮模型调用与工具调用

Codex 完成一次复杂任务,可能要读取源码、检索部署记录、查看故障报告、编辑文件并运行测试。一次用户请求内部往往包含几十轮模型与工具调用,因此上下文拼装、数据传输或进程启动每增加一点开销,都会在循环中被反复放大。

OpenAI 的智能体编排层从三个方向减少重复工作:延迟发现工具,避免无关 MCP、技能和插件提前占满上下文;限制单个工具的默认输出规模;保持历史和工具定义的稳定顺序,让提示词缓存能够持续命中。

仅追加上下文帮助保持可复用的提示词缓存前缀
仅追加上下文帮助保持可复用的提示词缓存前缀

模型可见历史采用仅追加模式:新消息、工具结果和环境变化写在上下文末尾,不回头插入或改写旧内容。这样后续请求可以复用此前已计算的精确前缀。工具也以确定顺序提供,审批策略等运行时信息在执行阶段应用,避免工具定义变化破坏缓存。

三、ARC-AGI-3 暴露的不是单纯模型短板

ARC-AGI-3 是交互式二维解谜评测。官方通用 Harness 尽量保持简单,不挂载专用工具,用于比较模型在陌生环境中的观察、试错和规划能力。GPT-5.6 Sol 在半私有集上的官方验证成绩约为 7.78%,在公开集上约为 13.3%。

OpenAI 随后用 Responses API 重建 Harness,仅改变两项关键配置:保留跨轮推理状态使用上下文压缩替代滚动截断。在这套非官方对照设置中,公开集得分从约 13.3% 提升到 38.3%,输出 Token 则降到原来的约六分之一。

保留推理状态与上下文压缩对 ARC-AGI-3 得分和 Token 消耗的影响
保留推理状态与上下文压缩对 ARC-AGI-3 得分和 Token 消耗的影响
38.3% 不是 ARC-AGI-3 官方排行榜的新成绩,也不能与使用通用 Harness 的 7.78% 直接横向替换。它是一项对照实验,用来说明智能体状态管理和上下文策略会显著改变同一模型的长任务表现。

问题一:每轮都清空推理状态

在原始设置中,模型执行一步操作后,产生该操作的推理状态不会延续到下一轮。模型虽然能看到操作记录和简短备注,却无法继续使用此前形成的规则假设与计划,于是每一步都要重新理解盘面,既消耗 Token,也容易在不同策略间反复摇摆。

问题二:滚动截断会丢掉早期经验

当历史超过约 17.5 万字符时,原 Harness 直接删除最早消息。长游戏进行到后半段,模型不仅缺少完整推理状态,连早期试错和已验证规则也可能消失。这对需要跨越大量行动积累世界模型的任务尤其不利。

GPT-5.6 Sol 在长任务中通过压缩摘要延续推理状态
GPT-5.6 Sol 在长任务中通过压缩摘要延续推理状态

Responses API 可以通过前一轮响应 ID 延续多轮交互状态。接近上下文上限时,系统不简单删除开头,而是把历史压缩为摘要,再让后续推理在摘要、最近工具结果和新观察上继续。保留状态后,模型每步思考时间下降,并能把失败尝试转化为后续策略,而不是反复从零开始。

ARC 官方 Harness 与 Responses API Harness 的动态运行对比
ARC 官方 Harness 与 Responses API Harness 的动态运行对比

四、对开发者真正有用的三条结论

  • 评测模型时必须记录 Harness:模型版本相同,不代表工具、推理强度、状态延续和压缩策略相同。
  • 长任务需要保存“为什么这样做”:只有动作日志而没有计划状态,智能体很容易重复分析和犯同样错误。
  • 压缩优于粗暴截断:达到窗口上限时,应保留目标、约束、已验证结论、失败路径和待办状态,而不是只删除最早消息。

开发者还需要警惕另一面:保存更多状态会增加隐私、存储和错误累积风险。压缩摘要如果遗漏关键约束,也可能让错误长期留在任务中。因此生产系统应提供状态检查点、摘要审计、回滚机制和明确的数据保留策略。

五、对视频、CG 与后期工作流的启发

视频制作型智能体同样是长任务:读取脚本和分镜、整理素材、生成代理文件、运行转码、修改工程、检查画面并根据反馈继续迭代。只保留“执行了哪个命令”,却忘记镜头意图、客户限制和失败原因,智能体就会不断重做已经排除的方案。

做视频网观点:对于长周期后期项目,Harness 可能比单次模型跑分更重要。理想系统应把创作目标、镜头决策、素材状态、失败记录和审批结果做成可检查的项目记忆,并在上下文压缩时优先保留这些高价值信息。这样才能降低返工,而不是只让模型输出得更快。

六、硬件与人才消息应该怎么看

OpenAI 正在探索新的硬件交互,这一点可以确认;但屏幕、扬声器、可穿戴形态、售价与上市时间仍缺少正式信息。布罗克曼表达的重点更接近“今天使用电脑的交互效率不够高”,语音和智能体可能成为更自然的入口,而不是已经公布了某款确定产品。

翁荔曾在 OpenAI 负责研究与安全工作,之后成为 Thinking Machines Lab 联合创始人。她近期离开该公司以及长期研究 Harness、自我改进与安全,使“回归 OpenAI”的传闻受到关注;但在正式任命公布前,更稳妥的表述仍是可能回归,而非已经入职

结语

这轮信息的共同主线不是某一个模型突然觉醒,而是大模型竞争已经进入全栈工程阶段。GPU 内核、负载均衡、KV Cache、推测解码、工具编排、状态保留与上下文压缩,都会决定用户最终得到多少有效工作,以及每项工作需要付出多少算力。

GPT-5.6 Sol 参与优化自身运行环境,是模型成为基础设施共同研发者的早期信号;ARC-AGI-3 的对照结果则提醒开发者,模型能力只有在合适的 Harness 中才能稳定释放。下一阶段的差距,很可能不只来自模型权重,也来自谁能把模型、工具、记忆和验证连接成可靠闭环。

常见问题(FAQ)

GPT-5.6 Sol 真的能够自我进化吗?
它能在受控工程环境中优化生产GPU内核、草稿模型和服务配置,但没有直接修改自身核心主模型权重,目标、权限、验证和部署仍由人类系统控制。
GPT-5.6 Sol 如何降低 20% 服务成本?
它通过Codex分析生产流量、改进负载均衡,并用Triton和Gluon重写及优化生产GPU内核;这些改动与更广泛的内核优化共同降低了端到端服务成本。
ARC-AGI-3 的 38.3% 是官方排行榜成绩吗?
不是。38.3%来自OpenAI使用保留推理状态和上下文压缩的Responses API Harness对照实验,不能替代通用官方Harness下的正式排行榜成绩。
为什么保留推理状态能减少 Token 消耗?
模型可以继续使用此前形成的规则、计划和失败经验,不必每轮从头理解任务;上下文接近上限时再通过摘要压缩延续关键信息。
翁荔已经回归 OpenAI 了吗?
截至本文整理时,相关消息仍属于媒体传闻,OpenAI和翁荔本人尚未公开确认新的任职信息,因此不能视为已正式入职。
0 点赞
0 收藏
分享
0 讨论
反馈
0 讨论
热门最新
总结
暂无总结
0 / 600
嗨,下午好!
所有的成功,都源自一个勇敢的开始
近期热门