暂无菜单项

GPT-5.6 IQ 测试拿到136分:真能说明它比99%人类聪明吗?

发布于
12

GPT‑5.6 在 Tracking AI 的一套离线图形推理测试中拿到 136 分,首次让受测大模型跨过通常被称为“高智商区间”的 130 分线。随后,“GPT‑5.6 比99%人类更聪明”的说法迅速传播。

GPT‑5.6 在 Tracking AI 离线 IQ 测试中取得 136 分
GPT‑5.6 在 Tracking AI 离线 IQ 测试中取得 136 分
先给结论:136 分能说明 GPT‑5.6 在这套抽象模式识别题上表现突出,但不能直接证明它拥有等同于人类 IQ 136 的综合智力,更不能据此认定它在所有任务上都超过99%的人类。

GPT‑5.6 的 136 分是怎么测出来的?

Tracking AI 展示了两类测试。一类是公开的 Mensa Norway 风格题,题目可以在互联网上找到;另一类是由 Mensa 成员制作、没有公开放到互联网上的离线题库,目的在于降低模型从训练数据中直接“见过答案”的可能。

Tracking AI 的公开测试与离线测试说明
Tracking AI 的公开测试与离线测试说明

这次引发关注的是离线榜单。GPT‑5.6 的多个版本在该测试中达到136分,领先于同期被列入比较的其他模型。离线题库比公开题更能减少直接泄题的干扰,因此结果具有观察价值。

GPT‑5.6 多个版本在离线榜单中的成绩
GPT‑5.6 多个版本在离线榜单中的成绩
不同大模型的离线图形推理分数对比
不同大模型的离线图形推理分数对比

测试方法及每日结果可查看 Tracking AI 官方页面

为什么说“比99%人类聪明”并不严谨?

在人类标准化 IQ 分布中,130 分通常对应很高的百分位。但把大模型得分直接映射为“比多少人更聪明”,至少存在四个问题:

测试对象不同
人类 IQ 量表经过人群常模校准,大模型并不属于同一受测群体。
能力范围有限
图形推理主要测模式识别,无法覆盖事实可靠性、工具调用和现实判断。
提示方式影响结果
题目转写、视觉输入、采样参数和重复测试策略都会改变分数。
污染难以彻底排除
离线题可减少泄题,但类似题型和解题规律仍可能存在于训练数据中。
图形推理测试只能反映智能的一部分
图形推理测试只能反映智能的一部分
更准确的表述:GPT‑5.6 在一套未公开的 Mensa Norway 风格离线题中取得了相当于人类量表136分的换算结果。这是特定测试成绩,不是对模型综合智力的医学或心理测量结论。

离开考场,GPT‑5.6 能不能真正干活?

标准化分数只是第一层。对视频、设计和开发从业者而言,更重要的是模型能否把模糊需求转成完整交付物,能否调用工具、检查错误并在失败后继续推进。

开发者使用 GPT‑5.6 Sol 完成复杂任务
开发者使用 GPT‑5.6 Sol 完成复杂任务

公开体验中,有开发者让 GPT‑5.6 Sol 制作粒子流体模拟:模型处理了物理时间、界面、CSS 和渲染,并将结果组织为可以分享的单页应用。另一个案例则用一句需求生成基于 RAG 的客服工单系统,包括多种角色、管理后台、嵌入组件、投诉分类和回复草稿。

GPT‑5.6 生成物理模拟网页
GPT‑5.6 生成物理模拟网页
GPT‑5.6 构建带 RAG 的客服工单系统
GPT‑5.6 构建带 RAG 的客服工单系统

这些案例比单纯做题更接近真实 Agent 场景,但仍属于个别展示。判断模型是否适合项目,需要重复测试需求理解、代码正确率、工具调用、长任务稳定性和成本,而不是只看一次成功截图。

官方基准比 IQ 分数更完整吗?

OpenAI 官方并未用“人类 IQ”定义 GPT‑5.6,而是公布了编程、知识工作、科学、网络安全和长周期 Agent 工作流等基准。官方资料显示,GPT‑5.6 Sol 在 Agents’ Last Exam、编程 Agent 指数、Terminal‑Bench 与 DeepSWE 等评测中强调成功率、时间、Token 和成本的综合表现。

GPT‑5.6 官方强调编程与 Agent 工作流能力
GPT‑5.6 官方强调编程与 Agent 工作流能力

这类基准仍不能完全等同于真实生产环境,但比单一图形推理测试更接近模型的实际用途。特别是 Agent 任务,需要模型在多个步骤中保持目标、处理工具返回、发现错误并修正。

模型详情可查看 OpenAI GPT‑5.6 官方发布说明GPT‑5.6 官方帮助文档;站内已整理 GPT‑5.6 与 ChatGPT Work 完整介绍

从视频从业者角度,应该测什么?

对内容团队而言,IQ 分数几乎无法直接预测工作效果。更值得建立一套自己的业务测试:

  1. 需求理解:能否准确识别交付规格、受众、时长和风格限制。
  2. 素材处理:能否稳定读取文档、图片、字幕、表格与项目目录。
  3. 工作流执行:能否生成脚本、批处理文件、搭建网页并验证输出。
  4. 事实可靠性:遇到时效信息时是否主动检索,并区分事实、推断和观点。
  5. 成本与可控性:同类任务的 Token、耗时、失败率和人工返工量是否可接受。
真实项目更需要评估稳定性、成本和可控性
真实项目更需要评估稳定性、成本和可控性

准备体验完整 Agent 工作流,可进入 Codex 站内工具页;日常对话与多模态任务可查看 ChatGPT 站内详情。关于 GPT‑5.6 的额度和桌面端变化,站内还有 ChatGPT Codex 改版与 Token 分析

我的观点:136 分最重要的意义,不是给 GPT‑5.6 发一张“天才证书”,而是说明模型在陌生抽象题上的上限继续提高。真正决定它是否聪明的,是能否把这种推理稳定迁移到没有标准答案、需要工具和判断的现实任务中。

这算 AGI 吗?

仅凭一套 IQ 风格测试,无法得出 AGI 结论。AGI 涉及跨领域泛化、长期规划、环境适应、可靠行动和对不确定性的处理。一个模型可以在某类测试中达到高分,同时仍会产生事实错误、误解权限或在长任务中偏离目标。

更合理的判断是:GPT‑5.6 正在把“会做题”和“会使用工具完成工作”进一步结合。它距离一个完全可靠、可独立承担所有工作的通用智能仍有明显差距,但已经足以改变许多人的具体生产流程。

总结

GPT‑5.6 在 Tracking AI 离线测试中取得136分,是值得记录的推理能力信号;“比99%人类聪明”则是把特定测试百分位扩展成综合智力结论,传播效果很强,科学性不足。

对普通用户和专业团队来说,最有价值的不是争论模型有没有“天才 IQ”,而是拿自己的真实任务去测试:它能否稳定完成工作、是否减少返工、成本是否可控,以及出错时能不能被及时发现。

说明:测试成绩依据 Tracking AI 页面整理;GPT‑5.6 产品能力与官方基准依据 OpenAI 公开资料。第三方评测方法、模型版本和榜单可能持续更新。

常见问题(FAQ)

GPT-5.6 的 IQ 真的是136吗?
GPT-5.6 在 Tracking AI 的一套离线 Mensa Norway 风格测试中获得换算分数136;这属于第三方特定测试结果,并非针对大模型建立的人类临床 IQ 结论。
GPT-5.6 是否比99%人类更聪明?
不能这样直接推断。136分在人类常模中对应高百分位,但大模型与人类不是同一受测群体,测试也只覆盖抽象模式识别的一部分能力。
Tracking AI 的离线测试有什么意义?
题目没有公开在互联网上,可降低模型直接见过原题的可能,比公开题更适合观察陌生图形推理能力,但仍无法完全排除类似题型污染。
评价 GPT-5.6 应该看哪些指标?
除推理题外,还应关注真实任务成功率、事实可靠性、工具调用、长任务稳定性、速度、Token 成本和人工返工量。
0 点赞
0 收藏
分享
0 讨论
反馈
热门资讯
相关素材