在Tracking AI最新离线IQ测试中,OpenAI GPT-5. 6的多个版本均取得136分。这是大语言模型首次在该测试中将IQ推过130分。按照人类智商分布,130分通常被视为“天才”区间的起点,全球约只有1%的人达到这一水平。按这一标准,GPT-5. 6的测试成绩超过了99%的人类。

image.png

离线防作弊题库拿下136分,领先其他参测模型

Tracking AI使用了两套测试题库。其中一套是公开的、类似Mensa Norway的测试,模型此前已经取得140多分;另一套则是不公开的“离线题库”,用于降低模型提前接触和记忆答案的可能性。GPT-5. 6此次突破的正是这套离线题库。SOL、TERRA整个家族都取得了136分,视觉版本也保持了相同表现。排名其后的Claude-5 Fable为130分,GPT-5.6 LUNA Max和Claude-4.8 Opus则处于117至123分之间。过去一年,从o3到各家旗舰模型,多款产品都曾接近130分却未能越过这一门槛,而GPT-5. 6成为第一个完成突破的模型。

不仅测试成绩突出,实际任务表现也同样亮眼

除了IQ分数,开发者对GPT-5. 6的实际使用反馈也显示出较强的任务完成能力。开发者Amir Bohlooli使用同一个物理模拟prompt分别测试Fable5和GPT-5.6 Sol,原本预计Fable会占据优势,但GPT-5. 6选择了粒子流体模拟方案,并让物理过程按照真实时间推进,同时将CSS、界面和渲染内容整合进一个HTML文件,还自动托管为可分享网页,仅凭一句话就生成了完整成品。Ramanpal Singh则通过一句prompt制作出一个基于RAG的客服工单系统,其中包含四种角色、管理后台、自动投诉分类和情绪识别功能,一次生成了5个应用,成本只有Fable5的零头。

Claire Vo分享的经历则更能体现两者在处理问题时的差异。她曾被一个bug卡住,一度以为是自己的代码出现了问题;换用GPT-5.6 Sol后,她只留下“我就是不信搞不定”这一句话,Sol便一次完成修复,并顺手让其他模型也能够正常运行。她认为,Fable过度追求技术上的绝对精确,反而容易受到限制;Sol采取的务实方式,则真正把任务完成了。

有网友评价称:“对99%的人来说,这已经是AGI了。”不过,136分主要反映的是抽象模式识别和逻辑推理等“标准化认知”能力。IQ测试本身也更接近大语言模型擅长的任务类型,无法全面衡量事实可靠性、工具调用能力以及模型在真实职业场景中的稳定性。结合开发者的实际体验来看,GPT-5. 6展现出的意义在于,它正在逐步把“会做题”和“会做事”两种能力结合起来。对于模型从未遇到、也无法通过抄答案解决的新问题,能否持续稳定地完成任务,仍是衡量其真实能力的关键。