
OpenAI 在短时间内释放了多条技术和业务信息:GPT-5.6 Sol 开始参与优化承载自身运行的推理系统,生产 GPU 内核改进使端到端服务成本下降 20%,推测解码升级让 Token 生成效率提升超过 15%;与此同时,智能体 Harness 对长任务表现的影响,也在 ARC-AGI-3 上被进一步量化。
其他消息还包括 OpenAI 硬件研发、用户规模与人才流动。OpenAI 官方工程文章称,其产品已经服务约 10 亿活跃用户和超过 200 万家企业。格雷格·布罗克曼确认公司正在探索新的 AI 硬件交互,但设备形态、发布时间和规格仍未正式公布。
一、GPT-5.6 Sol 如何把服务成本压低 20%

模型完成训练后,每次回答仍要经过请求路由、任务调度、GPU 内核、缓存管理和模型前向计算。任何一个环节出现负载不均、显存搬运过多或数据布局低效,都会让 GPU 空转。GPT-5.6 Sol 在 Codex 中分析真实生产流量、寻找此前被忽视的不平衡,并测试新的路由与配置策略。
在底层计算部分,GPT-5.6 Sol 使用 Triton 与 Gluon 重写并优化生产 GPU 内核,寻找可以预计算、避免或并行的工作。OpenAI 表示,这些改动与更广泛的内核优化共同作用,使端到端服务成本下降 20%。这是其生产系统的整体结果,不等于所有第三方部署都能直接复现相同幅度。
推测解码让 Token 效率提升超过 15%
推测解码让更小的草稿模型先提出多个候选 Token,再由主模型并行校验。候选被接受时,一次主模型前向计算可以产出多个 Token,从而减少昂贵的串行生成步骤。GPT-5.6 Sol 围绕草稿模型的规模、结构与特征执行了数百组实验,还负责启动和监控训练,在硬件故障或训练不稳定时介入处理。

进一步的优化来自批处理、分片、KV Cache 和负载配置。提示词长度、输出长度、缓存命中率与请求类型不同,最优服务参数也不同。模型可以根据真实业务负载生成候选配置并批量评估,让过去依赖经验的粗粒度规则变成场景化调优。
二、智能体效率不只取决于模型速度

Codex 完成一次复杂任务,可能要读取源码、检索部署记录、查看故障报告、编辑文件并运行测试。一次用户请求内部往往包含几十轮模型与工具调用,因此上下文拼装、数据传输或进程启动每增加一点开销,都会在循环中被反复放大。
OpenAI 的智能体编排层从三个方向减少重复工作:延迟发现工具,避免无关 MCP、技能和插件提前占满上下文;限制单个工具的默认输出规模;保持历史和工具定义的稳定顺序,让提示词缓存能够持续命中。

模型可见历史采用仅追加模式:新消息、工具结果和环境变化写在上下文末尾,不回头插入或改写旧内容。这样后续请求可以复用此前已计算的精确前缀。工具也以确定顺序提供,审批策略等运行时信息在执行阶段应用,避免工具定义变化破坏缓存。
三、ARC-AGI-3 暴露的不是单纯模型短板
ARC-AGI-3 是交互式二维解谜评测。官方通用 Harness 尽量保持简单,不挂载专用工具,用于比较模型在陌生环境中的观察、试错和规划能力。GPT-5.6 Sol 在半私有集上的官方验证成绩约为 7.78%,在公开集上约为 13.3%。
OpenAI 随后用 Responses API 重建 Harness,仅改变两项关键配置:保留跨轮推理状态与使用上下文压缩替代滚动截断。在这套非官方对照设置中,公开集得分从约 13.3% 提升到 38.3%,输出 Token 则降到原来的约六分之一。

问题一:每轮都清空推理状态
在原始设置中,模型执行一步操作后,产生该操作的推理状态不会延续到下一轮。模型虽然能看到操作记录和简短备注,却无法继续使用此前形成的规则假设与计划,于是每一步都要重新理解盘面,既消耗 Token,也容易在不同策略间反复摇摆。
问题二:滚动截断会丢掉早期经验
当历史超过约 17.5 万字符时,原 Harness 直接删除最早消息。长游戏进行到后半段,模型不仅缺少完整推理状态,连早期试错和已验证规则也可能消失。这对需要跨越大量行动积累世界模型的任务尤其不利。

Responses API 可以通过前一轮响应 ID 延续多轮交互状态。接近上下文上限时,系统不简单删除开头,而是把历史压缩为摘要,再让后续推理在摘要、最近工具结果和新观察上继续。保留状态后,模型每步思考时间下降,并能把失败尝试转化为后续策略,而不是反复从零开始。

四、对开发者真正有用的三条结论
- 评测模型时必须记录 Harness:模型版本相同,不代表工具、推理强度、状态延续和压缩策略相同。
- 长任务需要保存“为什么这样做”:只有动作日志而没有计划状态,智能体很容易重复分析和犯同样错误。
- 压缩优于粗暴截断:达到窗口上限时,应保留目标、约束、已验证结论、失败路径和待办状态,而不是只删除最早消息。
开发者还需要警惕另一面:保存更多状态会增加隐私、存储和错误累积风险。压缩摘要如果遗漏关键约束,也可能让错误长期留在任务中。因此生产系统应提供状态检查点、摘要审计、回滚机制和明确的数据保留策略。
五、对视频、CG 与后期工作流的启发
视频制作型智能体同样是长任务:读取脚本和分镜、整理素材、生成代理文件、运行转码、修改工程、检查画面并根据反馈继续迭代。只保留“执行了哪个命令”,却忘记镜头意图、客户限制和失败原因,智能体就会不断重做已经排除的方案。
六、硬件与人才消息应该怎么看
OpenAI 正在探索新的硬件交互,这一点可以确认;但屏幕、扬声器、可穿戴形态、售价与上市时间仍缺少正式信息。布罗克曼表达的重点更接近“今天使用电脑的交互效率不够高”,语音和智能体可能成为更自然的入口,而不是已经公布了某款确定产品。
翁荔曾在 OpenAI 负责研究与安全工作,之后成为 Thinking Machines Lab 联合创始人。她近期离开该公司以及长期研究 Harness、自我改进与安全,使“回归 OpenAI”的传闻受到关注;但在正式任命公布前,更稳妥的表述仍是可能回归,而非已经入职。
结语
这轮信息的共同主线不是某一个模型突然觉醒,而是大模型竞争已经进入全栈工程阶段。GPU 内核、负载均衡、KV Cache、推测解码、工具编排、状态保留与上下文压缩,都会决定用户最终得到多少有效工作,以及每项工作需要付出多少算力。
GPT-5.6 Sol 参与优化自身运行环境,是模型成为基础设施共同研发者的早期信号;ARC-AGI-3 的对照结果则提醒开发者,模型能力只有在合适的 Harness 中才能稳定释放。下一阶段的差距,很可能不只来自模型权重,也来自谁能把模型、工具、记忆和验证连接成可靠闭环。






