
OpenAI 公布了一组很容易让人产生联想的数据:GPT-5.6 Sol 在 Codex 中参与优化生产推理系统后,端到端服务成本下降 20%;改进推测解码后,Token 生成效率提升超过 15%。
“AI 开始给自己写代码”这个说法抓住了事件的冲击力,但必须先划清边界:GPT-5.6 Sol 并没有直接修改自己的核心模型权重,也不是在无人控制下制造下一代模型。它优化的是承载模型运行的推理基础设施、GPU 内核、草稿模型与服务配置。

一、20% 的成本下降,不是靠一个“魔法按钮”
大模型完成训练之后,每一次回答仍要在 GPU 集群上执行推理。请求送到哪里、什么时候运行、如何分配显存、哪些计算可以复用,以及底层内核是否高效,都会影响每个 Token 的成本。OpenAI 披露的改进覆盖了整个推理栈,而不是只优化某一项跑分。
1. 先把请求分得更合理
GPT-5.6 Sol 分析真实生产流量,寻找此前未被发现的负载不均衡,并测试新的路由策略。全球层面要考虑地域、可用容量和加速器类型;集群内部还要结合上下文长度、缓存状态和实例负载分配任务。如果部分 GPU 长期排队而另一部分处于空闲,再强的芯片也无法转化为有效吞吐。
2. 重写真正跑在 GPU 上的生产内核
模型前向计算由大量 GPU 内核组成。即使单个数学运算很快,不必要的显存搬运、同步等待和低效数据布局,仍会让 GPU 出现空转。GPT-5.6 Sol 借助 Codex 自主重写并优化了使用 Triton 与 Gluon 编写的生产内核,找出可以预计算、跳过或并行执行的部分。
OpenAI 表示,这些工作与更广泛的内核改进叠加后,使端到端服务成本降低 20%。需要注意,这个数字针对其生产系统整体,并不等于任何用户在本地部署模型都能直接获得同样幅度的提升。

二、超过 15% 的 Token 效率,来自推测解码
推测解码可以理解为让一个更小、更快的“草稿模型”先猜接下来可能出现的多个 Token,再由主模型并行验证。猜中时,主模型一次前向计算就能接受多个结果,从而减少昂贵的串行生成步骤;猜错时则回退到主模型的正确输出,因此目标是在不改变结果质量的前提下提高速度。
GPT-5.6 Sol 为自己的草稿模型设计并执行了数百次架构实验,测试不同尺寸、结构与特征;它还启动并监控训练过程,在硬件故障或训练不稳定时介入处理。最终,相关改进把 Token 生成效率提高了 15% 以上。

三、KV Cache 与工作负载配置同样重要
模型读取未缓存的输入时,会在一次计算密集型过程中建立 KV Cache;生成输出时,又会反复读取并扩展这份缓存。批处理大小、模型切分方式、缓存命中率、提示词长度和输出长度彼此关联,最优配置会随工作负载变化。
过去,这个组合空间太大,工程师往往只能依赖经验和宽泛规则。现在,GPT-5.6 Sol 可以分析生产负载、生成候选配置并批量评估,让引擎针对不同场景进行更细的调优。它的价值不是取代某个算法,而是把大量原本做不完的试验真正跑起来。
| 优化环节 | 主要问题 | 带来的价值 |
|---|---|---|
| 负载均衡 | 请求分配不均、硬件空闲 | 提升集群利用率 |
| GPU 内核 | 显存搬运、同步与数据布局低效 | 降低端到端服务成本 |
| 推测解码 | Token 串行生成昂贵 | 一次验证接受多个 Token |
| KV Cache 与配置 | 组合空间过大、规则粗糙 | 按真实负载精细调优 |
四、真正发生变化的是研发闭环

这次最值得关注的,不只是 20% 和 15% 两个数字,而是模型进入了完整的工程反馈回路:测量生产行为 → 找出瓶颈 → 编写代码 → 发起实验 → 监控异常 → 验证结果。Codex 把代码仓库、测试、日志和工具连接起来,使模型可以在一次任务中完成多轮观察与执行。
与此同时,智能体自身的运行方式也被优化。Codex 与 ChatGPT Work 使用 Rust 编排层连接模型、工具和用户环境,通过延迟发现工具、限制工具输出、保持工具顺序稳定,以及把上下文设计为只追加历史,提高提示词缓存命中率,减少每一轮都重复传输和计算的内容。
这说明 AI 工程的竞争正在从“谁能写出一段代码”转向“谁能持续完成可测量、可验证、可部署的工程循环”。模型生成方案只是起点,评估体系、测试工具、观测数据和回滚机制才决定它能不能进入生产环境。
五、这算不算递归自我改进?
严格来说,目前更准确的表述是受控的系统级自我优化,而不是可以无限加速的递归自我改进。GPT-5.6 Sol 优化了运行自身及其他模型的基础设施,但目标、权限、算力、训练流程和上线标准仍由人类团队及既有系统提供。
- 没有直接改写主模型权重:核心模型仍来自既定训练流程。
- 不是自由访问生产环境:工具和权限由工程系统明确授予。
- 结果需要验证:OpenAI 使用包括 FpSan 在内的工具检查浮点 GPU 内核正确性。
- 局部变快不等于整体变好:改动必须在延迟、容量、可靠性与完整系统成本上复核。

OpenAI 给出的内部 RSI Index 评估中,GPT-5.6 Sol 相比 GPT-5.5 提升 16.2 分;活跃研究人员的日均输出 Token 超过 GPT-5.5 峰值的两倍,内部编码推理算力份额增长约 100 倍,智能体 Token 使用量增长约 22 倍。这些指标来自 OpenAI 内部工作负载,应视为其组织内采用情况,不能直接等同于第三方通用基准。
六、对视频、CG 和后期团队意味着什么?
对后期从业者来说,这套方法比“AI 会不会取代剪辑师”更有现实意义。渲染、转码、降噪、合成、代理文件生成、素材索引和集群调度,同样由大量可测量的代码与参数组成。未来的制作型智能体,很可能先从这些基础设施环节创造价值。
- 渲染与转码:分析真实任务队列,优化分片、缓存、节点调度和编码参数。
- GPU 插件与内核:协助寻找降噪、光流、抠像或图像算子的性能瓶颈,并生成候选实现。
- 工程自动化:根据日志定位失败镜头,修改脚本、运行回归测试,再提交可审查的变更。
- 资产管线:针对不同分辨率、格式和交付要求,自动评估缓存与代理策略。
结语
GPT-5.6 Sol 参与重写生产 GPU 内核,并围绕推测解码、负载均衡与 KV Cache 完成大规模实验,证明旗舰模型已经能反过来优化承载自己的软件系统。20% 的服务成本下降和超过 15% 的 Token 效率提升,也说明在算力紧张的环境里,软件与工作流优化可以像增加 GPU 一样重要。
但这仍是一套由人类设定目标、提供工具并负责验证的工程闭环,而不是模型脱离控制地自我升级。更准确也更有价值的结论是:AI 开始成为 AI 基础设施的共同研发者,而验证能力正在成为新的核心生产力。






