### [GPT-5.6 IQ 测试拿到136分:真能说明它比99%人类聪明吗?](https://www.zuoshipin.com/article/5646) **Published:** 2026-07-17T07:22:55 **Author:** 天才交易员 **Excerpt:** GPT‑5.6 在 Tracking AI 离线图形推理测试中取得136分,但“比99%人类聪明”并不是严谨结… GPT‑5.6 在 Tracking AI 的一套离线图形推理测试中拿到 **136 分**,首次让受测大模型跨过通常被称为“高智商区间”的 130 分线。随后,“GPT‑5.6 比99%人类更聪明”的说法迅速传播。 ![GPT‑5.6 在 Tracking AI 离线 IQ 测试中取得 136 分](https://admin.zuoshipin.com/wp-content/uploads/2026/07/gpt-5-6-iq-136-analysis-01.webp) GPT‑5.6 在 Tracking AI 离线 IQ 测试中取得 136 分 **先给结论:**136 分能说明 GPT‑5.6 在这套抽象模式识别题上表现突出,但不能直接证明它拥有等同于人类 IQ 136 的综合智力,更不能据此认定它在所有任务上都超过99%的人类。 ## GPT‑5.6 的 136 分是怎么测出来的? Tracking AI 展示了两类测试。一类是公开的 Mensa Norway 风格题,题目可以在互联网上找到;另一类是由 Mensa 成员制作、没有公开放到互联网上的离线题库,目的在于降低模型从训练数据中直接“见过答案”的可能。 ![Tracking AI 的公开测试与离线测试说明](https://admin.zuoshipin.com/wp-content/uploads/2026/07/gpt-5-6-iq-136-analysis-02.webp) Tracking AI 的公开测试与离线测试说明 这次引发关注的是离线榜单。GPT‑5.6 的多个版本在该测试中达到136分,领先于同期被列入比较的其他模型。离线题库比公开题更能减少直接泄题的干扰,因此结果具有观察价值。 ![GPT‑5.6 多个版本在离线榜单中的成绩](https://admin.zuoshipin.com/wp-content/uploads/2026/07/gpt-5-6-iq-136-analysis-03.webp) GPT‑5.6 多个版本在离线榜单中的成绩 ![不同大模型的离线图形推理分数对比](https://admin.zuoshipin.com/wp-content/uploads/2026/07/gpt-5-6-iq-136-analysis-04.webp) 不同大模型的离线图形推理分数对比 测试方法及每日结果可查看 [Tracking AI 官方页面](https://trackingai.org/)。 ## 为什么说“比99%人类聪明”并不严谨? 在人类标准化 IQ 分布中,130 分通常对应很高的百分位。但把大模型得分直接映射为“比多少人更聪明”,至少存在四个问题: **测试对象不同** 人类 IQ 量表经过人群常模校准,大模型并不属于同一受测群体。 **能力范围有限** 图形推理主要测模式识别,无法覆盖事实可靠性、工具调用和现实判断。 **提示方式影响结果** 题目转写、视觉输入、采样参数和重复测试策略都会改变分数。 **污染难以彻底排除** 离线题可减少泄题,但类似题型和解题规律仍可能存在于训练数据中。 ![图形推理测试只能反映智能的一部分](https://admin.zuoshipin.com/wp-content/uploads/2026/07/gpt-5-6-iq-136-analysis-05.webp) 图形推理测试只能反映智能的一部分 **更准确的表述:**GPT‑5.6 在一套未公开的 Mensa Norway 风格离线题中取得了相当于人类量表136分的换算结果。这是特定测试成绩,不是对模型综合智力的医学或心理测量结论。 ## 离开考场,GPT‑5.6 能不能真正干活? 标准化分数只是第一层。对视频、设计和开发从业者而言,更重要的是模型能否把模糊需求转成完整交付物,能否调用工具、检查错误并在失败后继续推进。 ![开发者使用 GPT‑5.6 Sol 完成复杂任务](https://admin.zuoshipin.com/wp-content/uploads/2026/07/gpt-5-6-iq-136-analysis-06.webp) 开发者使用 GPT‑5.6 Sol 完成复杂任务 公开体验中,有开发者让 GPT‑5.6 Sol 制作粒子流体模拟:模型处理了物理时间、界面、CSS 和渲染,并将结果组织为可以分享的单页应用。另一个案例则用一句需求生成基于 RAG 的客服工单系统,包括多种角色、管理后台、嵌入组件、投诉分类和回复草稿。 ![GPT‑5.6 生成物理模拟网页](https://admin.zuoshipin.com/wp-content/uploads/2026/07/gpt-5-6-iq-136-analysis-07.webp) GPT‑5.6 生成物理模拟网页 ![GPT‑5.6 构建带 RAG 的客服工单系统](https://admin.zuoshipin.com/wp-content/uploads/2026/07/gpt-5-6-iq-136-analysis-08.webp) GPT‑5.6 构建带 RAG 的客服工单系统 这些案例比单纯做题更接近真实 Agent 场景,但仍属于个别展示。判断模型是否适合项目,需要重复测试需求理解、代码正确率、工具调用、长任务稳定性和成本,而不是只看一次成功截图。 ## 官方基准比 IQ 分数更完整吗? OpenAI 官方并未用“人类 IQ”定义 GPT‑5.6,而是公布了编程、知识工作、科学、网络安全和长周期 Agent 工作流等基准。官方资料显示,GPT‑5.6 Sol 在 Agents’ Last Exam、编程 Agent 指数、Terminal‑Bench 与 DeepSWE 等评测中强调成功率、时间、Token 和成本的综合表现。 ![GPT‑5.6 官方强调编程与 Agent 工作流能力](https://admin.zuoshipin.com/wp-content/uploads/2026/07/gpt-5-6-iq-136-analysis-09.webp) GPT‑5.6 官方强调编程与 Agent 工作流能力 这类基准仍不能完全等同于真实生产环境,但比单一图形推理测试更接近模型的实际用途。特别是 Agent 任务,需要模型在多个步骤中保持目标、处理工具返回、发现错误并修正。 模型详情可查看 [OpenAI GPT‑5.6 官方发布说明](https://openai.com/index/gpt-5-6/) 和 [GPT‑5.6 官方帮助文档](https://help.openai.com/en/articles/20001354-gpt-56-in-chatgpt/);站内已整理 [GPT‑5.6 与 ChatGPT Work 完整介绍](https://www.zuoshipin.com/article/1334)。 ## 从视频从业者角度,应该测什么? 对内容团队而言,IQ 分数几乎无法直接预测工作效果。更值得建立一套自己的业务测试: 1. **需求理解:**能否准确识别交付规格、受众、时长和风格限制。 2. **素材处理:**能否稳定读取文档、图片、字幕、表格与项目目录。 3. **工作流执行:**能否生成脚本、批处理文件、搭建网页并验证输出。 4. **事实可靠性:**遇到时效信息时是否主动检索,并区分事实、推断和观点。 5. **成本与可控性:**同类任务的 Token、耗时、失败率和人工返工量是否可接受。 ![真实项目更需要评估稳定性、成本和可控性](https://admin.zuoshipin.com/wp-content/uploads/2026/07/gpt-5-6-iq-136-analysis-10.webp) 真实项目更需要评估稳定性、成本和可控性 准备体验完整 Agent 工作流,可进入 [Codex 站内工具页](https://www.zuoshipin.com/link/1474.html);日常对话与多模态任务可查看 [ChatGPT 站内详情](https://www.zuoshipin.com/link/29.html)。关于 GPT‑5.6 的额度和桌面端变化,站内还有 [ChatGPT Codex 改版与 Token 分析](https://www.zuoshipin.com/article/1414)。 **我的观点:**136 分最重要的意义,不是给 GPT‑5.6 发一张“天才证书”,而是说明模型在陌生抽象题上的上限继续提高。真正决定它是否聪明的,是能否把这种推理稳定迁移到没有标准答案、需要工具和判断的现实任务中。 ## 这算 AGI 吗? 仅凭一套 IQ 风格测试,无法得出 AGI 结论。AGI 涉及跨领域泛化、长期规划、环境适应、可靠行动和对不确定性的处理。一个模型可以在某类测试中达到高分,同时仍会产生事实错误、误解权限或在长任务中偏离目标。 更合理的判断是:GPT‑5.6 正在把“会做题”和“会使用工具完成工作”进一步结合。它距离一个完全可靠、可独立承担所有工作的通用智能仍有明显差距,但已经足以改变许多人的具体生产流程。 ## 总结 GPT‑5.6 在 Tracking AI 离线测试中取得136分,是值得记录的推理能力信号;“比99%人类聪明”则是把特定测试百分位扩展成综合智力结论,传播效果很强,科学性不足。 对普通用户和专业团队来说,最有价值的不是争论模型有没有“天才 IQ”,而是拿自己的真实任务去测试:它能否稳定完成工作、是否减少返工、成本是否可控,以及出错时能不能被及时发现。 说明:测试成绩依据 Tracking AI 页面整理;GPT‑5.6 产品能力与官方基准依据 OpenAI 公开资料。第三方评测方法、模型版本和榜单可能持续更新。 **Tags:** AI模型评测, GPT-5.6, OpenAI, Tracking AI **Categories:** AI资讯 ---