GPT-5.6 IQ首破130分:是“天才”诞生还是测试维度的胜利?

GPT-5.6 IQ 136:从“做题家”到“实干家”的跨越?

OpenAI 的 GPT-5.6 系列模型在 Tracking AI 发布的离线智商测试中取得了 136分 的历史性成绩,成为首个突破 130分“人类天才线”的大语言模型。这一分数意味着该模型在标准化认知能力上超越了全球约 99% 的人类。

核心亮点

  • 顶尖表现:GPT-5.6 家族(包括 SOL、TERRA 及视觉版)均达到 136分,显著领先于紧随其后的 Claude-5 Fable(130分)及其他头部模型。
  • 防作弊题库:该分数基于 Tracking AI 专门构建的防泄题离线题库,有效避免了模型通过训练数据“背题”的可能,更具含金量。
  • 工程能力验证:开发者实测显示,GPT-5.6 不仅在逻辑推理上表现出色,在物理模拟、全栈应用开发、Bug 修复等复杂工程任务中也展现出强大的实用价值。例如,它能将 CSS、界面和渲染代码整合为单个可分享网页,或一次性生成多个基于 RAG 的客服工单系统。

理性看待 IQ 136

尽管成绩斐然,但需理性认识 IQ 测试的局限性:

  1. 维度单一:IQ 测试主要衡量抽象模式识别和逻辑推理,无法全面评估事实可靠性、工具调用能力及非标准化场景下的表现。
  2. “做题” vs “做事”:真正的考验在于模型面对全新问题时能否保持逻辑稳定并给出有效解法。GPT-5.6 正在弥合“会做题”与“会做事”之间的鸿沟。

行业意义

GPT-5.6 的出现标志着 AI 能力的一个重要里程碑。当 AI 的智商正式迈入人类前 1% 行列,并开始大规模接管复杂工程任务时,人机协作的范式正在被重新书写。虽然这并非 AGI 的最终定义,但其展现出的强大实用价值和智能水平,无疑为 AI 技术的未来发展注入了强劲动力。


参考资料:Tracking AI 排行榜及相关开发者反馈