暂无菜单项

GPT-5.6 Sol推出Ultrafast模式:最高750 tokens/s,Cerebras如何将推理提速14倍

发布于
1
GPT-5.6 Sol Ultrafast模式预览消息
GPT-5.6 Sol Ultrafast模式预览消息

OpenAI与AI芯片厂商Cerebras联合预览了GPT-5.6 Sol的新服务层级Ultrafast Mode。官方公布的峰值输出速度达到750 tokens/s,相较约53 tokens/s的Standard模式,最高提升约14倍。

Ultrafast目前先在OpenAI API中向部分客户有限预览。查看站内相关产品:
ChatGPT:https://www.zuoshipin.com/link/29.html
Codex:https://www.zuoshipin.com/link/1474.html

这项变化真正值得关注的,不是聊天窗口里的文字更快滚动,而是高智能模型第一次接近实时交互速度。当Agent需要连续读文件、调用工具、分析结果并再次决策时,每一轮等待都会累积;单轮提速可以直接改变完整任务的可用性。

一、750 tokens/s意味着什么

主流AI模型智能水平与输出速度对比
主流AI模型智能水平与输出速度对比

在官方给出的速度与智能对比图中,GPT-5.6 Sol Ultrafast位于高智能、高输出速度区域。横向数字显示,其输出速度约为Fable 5的11倍,也约为Opus 4.8 Fast模式的5倍。

这里的14倍是“最高输出速度”与Standard基线之间的比较,不代表所有请求的首Token时间、完整任务耗时或API账单都会同步改善14倍。提示词长度、输出长度、工具等待、网络、并发和服务调度都会影响最终体验。

二、HLE测试:三天级任务被压到一个工作日

Cerebras公布了“人类最后的考试”(Humanity’s Last Exam,HLE)测试。该基准包含约2500道跨学科高难度问题,覆盖化学、经济学、文学等专业领域。

GPT-5.6 Sol Ultrafast与Claude Fable 5完成HLE测试的用时对比
GPT-5.6 Sol Ultrafast与Claude Fable 5完成HLE测试的用时对比

在这组测试中,GPT-5.6 Sol Ultrafast完成全部问题约用11小时11分钟;Claude Fable 5约用78小时27分钟。在准确率接近的前提下,前者用时约为后者的七分之一。

这类长基准更能体现吞吐的价值:输出不再是几秒钟的问答,而是数千道任务持续排队。但它仍是厂商给出的测试结果,真实业务要结合提示词、并发、重试与工具调用重新测量。

三、端到端速度比单纯Token速度更重要

GPT-5.6 Sol在GDP-Val任务中的推理与非推理耗时对比
GPT-5.6 Sol在GDP-Val任务中的推理与非推理耗时对比

OpenAI还用GDP-Val观察经济价值知识工作任务。在公布的样例中,Ultrafast把GPT-5.6 Sol的端到端耗时从约7.7分钟降至83秒,实现约5.6倍加速,同时保持相近质量。

为什么端到端只有5.6倍,而输出吞吐最高可到14倍?因为完整请求还包括排队、输入处理、推理准备、首Token等待和非推理步骤。对实际采购和流程设计而言,完成一件工作需要多久,通常比单一tokens/s更有意义。

四、速度提升会打开哪些实时工作流

  • 事件响应与可靠性:在故障持续发生时同步读取日志、代码变更与工程师报告,快速形成排查路径。
  • 金融研究与安全:在市场变化窗口内分析信号、交易与可疑活动。
  • 客户支持与语音:复杂多步骤查询不再因模型等待而频繁打断对话。
  • 商务与电商:在用户离开前完成库存查询、个性化推荐和结账问题处理。
  • 研究与实验:把隔夜批处理变成工作日内可反复调整的交互式实验。

OpenAI内部的事件响应测试就是一个例子。警报触发后,模型读取日志、追踪信息和团队对话,帮助验证假设并准备修复方案;工程师仍负责判断与部署,但从发现信号到选择下一步的等待显著缩短。

五、Cerebras如何绕开GPU的内存带宽瓶颈

大模型自回归解码时,每生成一个Token都需要访问大量模型权重。传统GPU主要依赖片外HBM,权重与计算核心之间的数据搬运会受显存带宽限制;模型切分到多张卡后,PCIe或高速互连又会引入通信延迟。

Cerebras WSE-3晶圆级引擎与NVIDIA B200 GPU尺寸对比
Cerebras WSE-3晶圆级引擎与NVIDIA B200 GPU尺寸对比

Cerebras WSE-3采用晶圆级设计,单颗芯片集成约4万亿晶体管、125 petaflops峰值AI算力与44GB片上SRAM。它试图让更多参数和中间数据留在高带宽片上存储中,减少在片外内存与计算核心之间反复搬运的等待。

GPT-5.6 Sol的完整模型显然不可能全部装进一颗芯片。Cerebras采用多晶圆流水线并行,把不同网络层放在多颗晶圆上,各层参数常驻对应芯片,再让Token沿流水线传递。其核心思路不是把一颗GPU做得更快,而是重新设计模型权重驻留和跨设备执行方式。

六、对Agent、CG和视频后期流程的实际影响

代码Agent最直接受益。多轮工具调用、代码生成、测试、读报错、修复和再次验证,通常包含几十次模型往返。高吞吐可以把原本需要数小时的长任务压缩到更适合人工监督的时间窗口,也减少开发者在等待中切换注意力。

在CG与视频后期管线中,模型可以更快分析渲染日志、检查素材命名与缺帧、生成DCC脚本、整理镜头元数据、汇总审片意见或驱动自动化QC。速度足够快后,艺术家可以边调整方案边让Agent重新检查,而不是把任务扔到后台第二天再看。

速度不等于可以取消审核。涉及工程覆盖、素材删除、渲染农场提交、成片发布或高额API调用时,仍应保留版本控制、权限边界和人工确认。更快的错误同样会更快扩散。

七、真正需要关注的三个变量

1. 价格与配额

有限预览阶段最关键的信息还包括定价、速率限制、并发和区域可用性。高端硬件带来的速度如果对应更高单价,团队需要判断它适合全程使用,还是只放在故障响应、实时交互和关键路径。

2. 吞吐与首Token延迟

750 tokens/s描述的是持续输出能力。实时语音和交互式Agent还关心首Token延迟;长篇生成、批量研究则更关心稳定吞吐与任务完成时间。

3. 速度与Token消耗

更快的模型会鼓励Agent执行更多轮搜索、验证和修正。单次任务时间可能下降,但Token总量和调用次数未必下降。评估时应同时记录时间、质量、Token、工具次数、失败率和最终成本。

AI社区对超高速模型改变研究工作节奏的讨论
AI社区对超高速模型改变研究工作节奏的讨论

结语:AI开始从“等待结果”走向“同步协作”

GPT-5.6 Sol Ultrafast的意义,不只是把聊天回复从快变得更快,而是让旗舰模型进入故障处理、实时研究、语音服务和长链Agent的关键路径。过去为了速度不得不换用次级模型的任务,现在有机会继续使用高能力模型。

不过,14倍仍是峰值输出速度口径。真正决定生产价值的,是端到端时延、质量、稳定性、并发、价格与安全机制能否同时成立。当这些条件补齐,AI工作方式才会从“提交后等待”转向真正的同步协作。

常见问题(FAQ)

GPT-5.6 Sol Ultrafast模式有多快?
官方公布的峰值输出速度最高约750 tokens/s,相比约53 tokens/s的Standard模式,最高提升约14倍。
14倍加速是否代表所有任务都快14倍?
不是。14倍主要比较峰值输出吞吐,完整任务还受首Token延迟、输入处理、工具等待、网络、并发和输出长度影响。
Ultrafast模式目前可以直接使用吗?
它首先在OpenAI API中面向部分客户进行有限预览,具体开放范围、价格、配额和速率限制应以实际账户信息为准。
Cerebras为什么能提高大模型输出速度?
WSE-3采用晶圆级计算与大容量片上SRAM,并通过多晶圆流水线让不同模型层的参数常驻对应芯片,减少片外内存搬运和跨设备通信等待。
超高速推理对Agent工作流有什么帮助?
它能缩短多轮工具调用、代码生成、日志分析、测试修复和研究迭代的等待,但仍需同时评估质量、Token消耗、成本、权限与失败率。
0 点赞
0 收藏
分享
0 讨论
反馈
0 讨论
热门最新
总结
暂无总结
0 / 600