### [AI开始给自己写代码了!GPT-5.6重写内核,服务成本直降20%](https://www.zuoshipin.com/article/18242) **Published:** 2026-07-30T16:30:14 **Author:** 天才交易员 **Excerpt:** GPT-5.6 Sol借助Codex优化生产GPU内核、负载均衡、推测解码和KV Cache,使OpenAI服… ![GPT-5.6 Sol 优化生产推理系统后的关键效率数据](https://admin.zuoshipin.com/wp-content/uploads/2026/07/gpt56-sol-efficiency-01.webp) GPT-5.6 Sol 优化生产推理系统后的关键效率数据 OpenAI 公布了一组很容易让人产生联想的数据:GPT-5.6 Sol 在 Codex 中参与优化生产推理系统后,**端到端服务成本下降 20%**;改进推测解码后,**Token 生成效率提升超过 15%**。 “AI 开始给自己写代码”这个说法抓住了事件的冲击力,但必须先划清边界:GPT-5.6 Sol 并没有直接修改自己的核心模型权重,也不是在无人控制下制造下一代模型。它优化的是**承载模型运行的推理基础设施、GPU 内核、草稿模型与服务配置**。 想了解 Codex 的能力与使用入口,可查看做视频网收录的 [Codex 站内详情页](https://www.zuoshipin.com/link/1474.html)。 ![GPT-5.6 Sol 被用于提升生产服务效率](https://admin.zuoshipin.com/wp-content/uploads/2026/07/gpt56-sol-efficiency-02.webp) GPT-5.6 Sol 被用于提升生产服务效率 ## 一、20% 的成本下降,不是靠一个“魔法按钮” 大模型完成训练之后,每一次回答仍要在 GPU 集群上执行推理。请求送到哪里、什么时候运行、如何分配显存、哪些计算可以复用,以及底层内核是否高效,都会影响每个 Token 的成本。OpenAI 披露的改进覆盖了整个推理栈,而不是只优化某一项跑分。 ### 1\. 先把请求分得更合理 GPT-5.6 Sol 分析真实生产流量,寻找此前未被发现的负载不均衡,并测试新的路由策略。全球层面要考虑地域、可用容量和加速器类型;集群内部还要结合上下文长度、缓存状态和实例负载分配任务。如果部分 GPU 长期排队而另一部分处于空闲,再强的芯片也无法转化为有效吞吐。 ### 2\. 重写真正跑在 GPU 上的生产内核 模型前向计算由大量 GPU 内核组成。即使单个数学运算很快,不必要的显存搬运、同步等待和低效数据布局,仍会让 GPU 出现空转。GPT-5.6 Sol 借助 Codex 自主重写并优化了使用 **Triton 与 Gluon** 编写的生产内核,找出可以预计算、跳过或并行执行的部分。 OpenAI 表示,这些工作与更广泛的内核改进叠加后,使端到端服务成本降低 20%。需要注意,这个数字针对其生产系统整体,并不等于任何用户在本地部署模型都能直接获得同样幅度的提升。 ![模型参与优化自身推理基础设施的思路](https://admin.zuoshipin.com/wp-content/uploads/2026/07/gpt56-sol-efficiency-03.webp) 模型参与优化自身推理基础设施的思路 ## 二、超过 15% 的 Token 效率,来自推测解码 推测解码可以理解为让一个更小、更快的“草稿模型”先猜接下来可能出现的多个 Token,再由主模型并行验证。猜中时,主模型一次前向计算就能接受多个结果,从而减少昂贵的串行生成步骤;猜错时则回退到主模型的正确输出,因此目标是在不改变结果质量的前提下提高速度。 GPT-5.6 Sol 为自己的草稿模型设计并执行了数百次架构实验,测试不同尺寸、结构与特征;它还启动并监控训练过程,在硬件故障或训练不稳定时介入处理。最终,相关改进把 Token 生成效率提高了 15% 以上。 **关键区别:**这里的“改进自己的草稿模型”不等于 GPT-5.6 Sol 重写自身主模型权重。草稿模型是推测解码流程中的辅助组件,候选方案、训练任务和部署仍运行在工程团队设定的系统与验证机制内。 ![GPT-5.6 从智能体编排到 GPU 推理的分层效率优化](https://admin.zuoshipin.com/wp-content/uploads/2026/07/gpt56-sol-efficiency-04.webp) GPT-5.6 从智能体编排到 GPU 推理的分层效率优化 ## 三、KV Cache 与工作负载配置同样重要 模型读取未缓存的输入时,会在一次计算密集型过程中建立 KV Cache;生成输出时,又会反复读取并扩展这份缓存。批处理大小、模型切分方式、缓存命中率、提示词长度和输出长度彼此关联,最优配置会随工作负载变化。 过去,这个组合空间太大,工程师往往只能依赖经验和宽泛规则。现在,GPT-5.6 Sol 可以分析生产负载、生成候选配置并批量评估,让引擎针对不同场景进行更细的调优。它的价值不是取代某个算法,而是把大量原本做不完的试验真正跑起来。 | 优化环节 | 主要问题 | 带来的价值 | | --- | --- | --- | | 负载均衡 | 请求分配不均、硬件空闲 | 提升集群利用率 | | GPU 内核 | 显存搬运、同步与数据布局低效 | 降低端到端服务成本 | | 推测解码 | Token 串行生成昂贵 | 一次验证接受多个 Token | | KV Cache 与配置 | 组合空间过大、规则粗糙 | 按真实负载精细调优 | ## 四、真正发生变化的是研发闭环 ![智能体在一次任务中反复调用模型与工具的运行循环](https://admin.zuoshipin.com/wp-content/uploads/2026/07/gpt56-sol-efficiency-05.webp) 智能体在一次任务中反复调用模型与工具的运行循环 这次最值得关注的,不只是 20% 和 15% 两个数字,而是模型进入了完整的工程反馈回路:**测量生产行为 → 找出瓶颈 → 编写代码 → 发起实验 → 监控异常 → 验证结果**。Codex 把代码仓库、测试、日志和工具连接起来,使模型可以在一次任务中完成多轮观察与执行。 与此同时,智能体自身的运行方式也被优化。Codex 与 ChatGPT Work 使用 Rust 编排层连接模型、工具和用户环境,通过延迟发现工具、限制工具输出、保持工具顺序稳定,以及把上下文设计为只追加历史,提高提示词缓存命中率,减少每一轮都重复传输和计算的内容。 这说明 AI 工程的竞争正在从“谁能写出一段代码”转向“谁能持续完成可测量、可验证、可部署的工程循环”。模型生成方案只是起点,评估体系、测试工具、观测数据和回滚机制才决定它能不能进入生产环境。 ## 五、这算不算递归自我改进? 严格来说,目前更准确的表述是**受控的系统级自我优化**,而不是可以无限加速的递归自我改进。GPT-5.6 Sol 优化了运行自身及其他模型的基础设施,但目标、权限、算力、训练流程和上线标准仍由人类团队及既有系统提供。 - **没有直接改写主模型权重:**核心模型仍来自既定训练流程。 - **不是自由访问生产环境:**工具和权限由工程系统明确授予。 - **结果需要验证:**OpenAI 使用包括 FpSan 在内的工具检查浮点 GPU 内核正确性。 - **局部变快不等于整体变好:**改动必须在延迟、容量、可靠性与完整系统成本上复核。 ![GPT-5.6 Sol 与 GPT-5.5 的成本效率评估对比](https://admin.zuoshipin.com/wp-content/uploads/2026/07/gpt56-sol-efficiency-06.webp) GPT-5.6 Sol 与 GPT-5.5 的成本效率评估对比 OpenAI 给出的内部 RSI Index 评估中,GPT-5.6 Sol 相比 GPT-5.5 提升 16.2 分;活跃研究人员的日均输出 Token 超过 GPT-5.5 峰值的两倍,内部编码推理算力份额增长约 100 倍,智能体 Token 使用量增长约 22 倍。这些指标来自 OpenAI 内部工作负载,应视为其组织内采用情况,不能直接等同于第三方通用基准。 ## 六、对视频、CG 和后期团队意味着什么? 对后期从业者来说,这套方法比“AI 会不会取代剪辑师”更有现实意义。渲染、转码、降噪、合成、代理文件生成、素材索引和集群调度,同样由大量可测量的代码与参数组成。未来的制作型智能体,很可能先从这些基础设施环节创造价值。 - **渲染与转码:**分析真实任务队列,优化分片、缓存、节点调度和编码参数。 - **GPU 插件与内核:**协助寻找降噪、光流、抠像或图像算子的性能瓶颈,并生成候选实现。 - **工程自动化:**根据日志定位失败镜头,修改脚本、运行回归测试,再提交可审查的变更。 - **资产管线:**针对不同分辨率、格式和交付要求,自动评估缓存与代理策略。 **做视频网观点:**下一阶段的分水岭不是“谁能让 AI 多写几行代码”,而是谁拥有真实工作负载、清晰评估标准和可靠验证工具。后期团队最值得建设的是可观测、可复现的制作管线:只有知道一项改动究竟节省了多少时间、显存和返工,智能体才可能从聊天助手变成生产力系统。 ## 结语 GPT-5.6 Sol 参与重写生产 GPU 内核,并围绕推测解码、负载均衡与 KV Cache 完成大规模实验,证明旗舰模型已经能反过来优化承载自己的软件系统。20% 的服务成本下降和超过 15% 的 Token 效率提升,也说明在算力紧张的环境里,软件与工作流优化可以像增加 GPU 一样重要。 但这仍是一套由人类设定目标、提供工具并负责验证的工程闭环,而不是模型脱离控制地自我升级。更准确也更有价值的结论是:AI 开始成为 AI 基础设施的共同研发者,而验证能力正在成为新的核心生产力。 **Tags:** AI推理优化, AI自我优化, GPT-5.6 Sol, GPU内核优化, 推测解码 **Categories:** AI资讯 ---