GPT‑5.6 在 Tracking AI 的一套离线图形推理测试中拿到 136 分,首次让受测大模型跨过通常被称为“高智商区间”的 130 分线。随后,“GPT‑5.6 比99%人类更聪明”的说法迅速传播。

GPT‑5.6 的 136 分是怎么测出来的?
Tracking AI 展示了两类测试。一类是公开的 Mensa Norway 风格题,题目可以在互联网上找到;另一类是由 Mensa 成员制作、没有公开放到互联网上的离线题库,目的在于降低模型从训练数据中直接“见过答案”的可能。

这次引发关注的是离线榜单。GPT‑5.6 的多个版本在该测试中达到136分,领先于同期被列入比较的其他模型。离线题库比公开题更能减少直接泄题的干扰,因此结果具有观察价值。


测试方法及每日结果可查看 Tracking AI 官方页面。
为什么说“比99%人类聪明”并不严谨?
在人类标准化 IQ 分布中,130 分通常对应很高的百分位。但把大模型得分直接映射为“比多少人更聪明”,至少存在四个问题:
人类 IQ 量表经过人群常模校准,大模型并不属于同一受测群体。
图形推理主要测模式识别,无法覆盖事实可靠性、工具调用和现实判断。
题目转写、视觉输入、采样参数和重复测试策略都会改变分数。
离线题可减少泄题,但类似题型和解题规律仍可能存在于训练数据中。

离开考场,GPT‑5.6 能不能真正干活?
标准化分数只是第一层。对视频、设计和开发从业者而言,更重要的是模型能否把模糊需求转成完整交付物,能否调用工具、检查错误并在失败后继续推进。

公开体验中,有开发者让 GPT‑5.6 Sol 制作粒子流体模拟:模型处理了物理时间、界面、CSS 和渲染,并将结果组织为可以分享的单页应用。另一个案例则用一句需求生成基于 RAG 的客服工单系统,包括多种角色、管理后台、嵌入组件、投诉分类和回复草稿。


这些案例比单纯做题更接近真实 Agent 场景,但仍属于个别展示。判断模型是否适合项目,需要重复测试需求理解、代码正确率、工具调用、长任务稳定性和成本,而不是只看一次成功截图。
官方基准比 IQ 分数更完整吗?
OpenAI 官方并未用“人类 IQ”定义 GPT‑5.6,而是公布了编程、知识工作、科学、网络安全和长周期 Agent 工作流等基准。官方资料显示,GPT‑5.6 Sol 在 Agents’ Last Exam、编程 Agent 指数、Terminal‑Bench 与 DeepSWE 等评测中强调成功率、时间、Token 和成本的综合表现。

这类基准仍不能完全等同于真实生产环境,但比单一图形推理测试更接近模型的实际用途。特别是 Agent 任务,需要模型在多个步骤中保持目标、处理工具返回、发现错误并修正。
模型详情可查看 OpenAI GPT‑5.6 官方发布说明 和 GPT‑5.6 官方帮助文档;站内已整理 GPT‑5.6 与 ChatGPT Work 完整介绍。
从视频从业者角度,应该测什么?
对内容团队而言,IQ 分数几乎无法直接预测工作效果。更值得建立一套自己的业务测试:
- 需求理解:能否准确识别交付规格、受众、时长和风格限制。
- 素材处理:能否稳定读取文档、图片、字幕、表格与项目目录。
- 工作流执行:能否生成脚本、批处理文件、搭建网页并验证输出。
- 事实可靠性:遇到时效信息时是否主动检索,并区分事实、推断和观点。
- 成本与可控性:同类任务的 Token、耗时、失败率和人工返工量是否可接受。

准备体验完整 Agent 工作流,可进入 Codex 站内工具页;日常对话与多模态任务可查看 ChatGPT 站内详情。关于 GPT‑5.6 的额度和桌面端变化,站内还有 ChatGPT Codex 改版与 Token 分析。
这算 AGI 吗?
仅凭一套 IQ 风格测试,无法得出 AGI 结论。AGI 涉及跨领域泛化、长期规划、环境适应、可靠行动和对不确定性的处理。一个模型可以在某类测试中达到高分,同时仍会产生事实错误、误解权限或在长任务中偏离目标。
更合理的判断是:GPT‑5.6 正在把“会做题”和“会使用工具完成工作”进一步结合。它距离一个完全可靠、可独立承担所有工作的通用智能仍有明显差距,但已经足以改变许多人的具体生产流程。
总结
GPT‑5.6 在 Tracking AI 离线测试中取得136分,是值得记录的推理能力信号;“比99%人类聪明”则是把特定测试百分位扩展成综合智力结论,传播效果很强,科学性不足。
对普通用户和专业团队来说,最有价值的不是争论模型有没有“天才 IQ”,而是拿自己的真实任务去测试:它能否稳定完成工作、是否减少返工、成本是否可控,以及出错时能不能被及时发现。
说明:测试成绩依据 Tracking AI 页面整理;GPT‑5.6 产品能力与官方基准依据 OpenAI 公开资料。第三方评测方法、模型版本和榜单可能持续更新。












