AI IQ 引发激烈论战:用人类智商分数衡量大模型,是革新还是误导?

5.15 对于首席信息官们而言,信号明确在价值50美元的模型和3美元的模型之间的智能差距已大幅缩小,智能路由将困难任务交给昂贵模型,简单任务交给廉价模型已成为主流架构

2026-05-15_104414_236


一套新上线的人工智能评分体系试图以人类IQ(智商)测试的逻辑为前沿大语言模型打分,并绘制出动态的“智商分布图”。这一大胆尝试在科技界迅速引发两极分化的反应:企业技术专家视其为穿透市场迷雾的利器,而众多研究人员与评论员则痛斥其“无稽之谈”,认为单一分数将严重误导对AI能力的认知。

 

这套名为“AI IQ”的评分体系由创业者和天使投资人Ryan Shea创立。Shea是区块链平台Stacks的联合创始人,也曾投资过多家独角兽企业。他创建的AI IQ网站( http://aiiq.org  )近期发布了超过50个主流语言模型的估算智商分数,并将其绘制在标准的正态分布曲线上,迅速在社交媒体上引发热议。

 


方法论:十二项基准、四个维度与一个争议数字

 

AI IQ的评分方法看似简明:它将12项业界常用基准测试归入四个推理维度——抽象推理、数学推理、编程推理和学术推理。模型的综合IQ即为这四个维度分数的算术平均值。

 

  • 抽象推理 参考了以衡量通用流体智力著称的ARC-AGI-1和ARC-AGI-2基准。

  • 数学推理 整合了FrontierMath、AIME和ProofBench。

  • 编程推理 采用了Terminal-Bench 2.0、SWE-Bench Verified和SciCode。

  • 学术推理 则基于Humanity's Last Exam、CritPt和GPQA Diamond。

 

每个原始基准分数通过“手工校准的难度曲线”映射为一个隐含的IQ值。该方法对被认为较易或易受数据污染的基准设置了天花板压缩,避免其将分数推高至100以上。对于更难的基准,则保留更高的上限。当数据缺失时,系统会保守处理,故意拉低而非抬高分数,确保“缺失覆盖不会让模型显得更好”。

aiiq-ai-models-by-iq-2026-05-15


数据洞察:2026年中期的AI智力版图

1. 顶端格局:前所未有的"压缩"

OpenAI GPT-5.5以约136 IQ独占鳌头,紧随其后的是:Anthropic Opus 4.7:~132 IQ(EQ维度实际领先),OpenAI GPT-5.4:~131 IQ,Google Gemini 3.1 Pro:~131 IQ,Anthropic Opus 4.6:~129 IQ

2. 中场混战:中国力量的崛起

在112-118 IQ区间,中国实验室模型形成密集集群:

Kimi K2.6(月之暗面),GLM-5(智谱),DeepSeek-V3.2,Qwen3.6(阿里),MiniMax-M2.7


核心发现:头部模型差距收窄,情商成新战场

 

截至2026年5月中旬的数据显示,AI IQ图表讲述了一个头部模型性能迅速收敛的故事。


aiiq-frontier-iq-over-time-2026-05-15

 

据“前沿IQ随时间变化图”显示,OpenAI的GPT-5.5以接近136的估算IQ高居榜首。GPT-5.4(约131)、Anthropic的Opus 4.7(约132)以及谷歌的Gemini 3.1 Pro(约131)紧随其后,顶级模型之间的差距微乎其微。

 

更引入注目的是情商(EQ)分数的引入。该分数基于EQ-Bench 3和Arena Elo分数估算。在IQ对EQ的散点图上,Anthropic的Opus 4.7以接近132的EQ得分领先,成为“高IQ、高EQ”的优选象限代表。而OpenAI的GPT-5.5和GPT-5.4则在IQ上领先,但EQ稍逊。

 

一个有趣的方法论细节是:EQ-Bench 3本身是由Anthropic的Claude模型评判的。为修正这一潜在的“家族偏见”,AI IQ主动对Anthropic所有模型在EQ-Bench部分施加了200分的Elo惩罚。这种自我修正机制在基准测试领域颇为罕见。

 


企业视角:成本-性能图或成采购新工具

 

对于企业用户而言,网站最有实用价值的图表可能是“IQ vs. 有效成本”散点图。它将模型的估算IQ与一个考虑了Token用量效率的“有效成本”指标进行对比。


aiiq-iq-vs-effective-cost-2026-05-15

 


图表揭示了一个熟悉模式:最佳模型并非总是最佳价值。GPT-5.5和Opus 4.7位于高IQ、高成本的左上角。而GPT-5.4-mini、DeepSeek-V3.2等模型则占据了一个理想的中部区域:IQ分数在112至120之间,而单任务有效成本仅为1至5美元。对于首席信息官们而言,信号明确:在价值50美元的模型和3美元的模型之间的智能差距已大幅缩小,智能路由——将困难任务交给昂贵模型,简单任务交给廉价模型——已成为主流架构。

 


激烈批评:“分数的地图并非真实领土”

 

然而,对AI IQ的批评同样猛烈,且直指根本。批评者认为,将模型参差不齐的“锯齿状”能力压缩为一个分数,其误导性远大于参考价值。

 

科技评论员Zaya在X平台(原推特)上指出:“IQ作为代理指标正在失效……GPT-5.5在MMLU-Pro上已饱和,但在ClockBench上仍有50%的时间失败。” 这触及了AI研究中著名的“锯齿状能力”问题:模型可能在研究生级别的物理上表现出色,却在儿童能完成的任务上失败。

 

用户Pressureangle则批评网站“完全缺乏透明度”,未充分披露校准曲线如何创建和验证。尽管AI IQ列出了基准并展示了校准曲线形状,但原始数据和精确数学变换并未作为开放数据集发布,这引发了对可复现性的担忧。

 

另一种替代方案已经存在:TrackingAI项目让模型直接参加“门萨挪威IQ测试”。但评论指出,门萨式测试仅测量抽象模式识别,而AI IQ试图构建一个更广泛的复合能力指标。每种方法各有取舍,尚无定论。


 

评论:混乱市场中的必要简化,但需警惕数字幻觉

 

AI IQ的诞生背景是AI评估领域的“巴别塔”困境:超过50个前沿模型、至少14家主要提供商,每家都发布对自己有利的基准测试。学术研究早已指出,“大多数基准测试通过专注于特定领域而引入偏见”。在这种信息不对称和混乱中,企业决策者急需一个横跨提供商、维度和价格点的统一比较框架。

 

从这个角度看,AI IQ的价值不在于其分数的绝对精确,而在于它提供了一个必要的简化模型。它将复杂的评估问题转化为一个可交互、可视化的决策工具,尤其当它引入成本维度和情商维度时,已经超越了传统单纯的性能排名。

 

然而,其根本性风险在于将“地图”误认为“领土”。一个IQ数字无法捕捉AI能力的“锯齿状”本质,可能掩盖特定任务上的灾难性失败。当企业根据单一IQ分数批量替换或部署模型时,这种简化可能带来不可预见的系统性风险。正如评论员所言,随着模型在现有最难的基准上也可能饱和,这套框架将面临所有AI评估都曾遇到的天花板效应。

 

最终,AI IQ数据最清晰的启示或许并非哪个模型“最聪明”,而是“编排智能”本身的兴起——根据任务、价格和情商需求,动态选择并组合最合适的模型,已成为一种超越单一分数的新智能。对于这项能力,目前还没有任何基准能够衡量。


AI IQ 引发激烈论战:用人类智商分数衡量大模型,是革新还是误导? | AIYXL