当前位置:首页 > 科技资讯 > 正文

AGI 定义的量化框架:GPT-4 和 GPT-5 的「差等生」表现

为 AGI 设定一条「及格线」,我们惊讶地发现,即使是前沿的 GPT-4 和 GPT-5,也未能达标。

通用人工智能(Artificial General Intelligence,AGI)是 AI 领域各实验室追逐的圣杯。然而,关于 AGI 的定义众说纷纭。我们究竟在追逐什么?

近日,图灵奖得主 Yoshua Bengio、前谷歌 CEO 埃里克·施密特等学者与行业领袖联手,为 AGI 提供了一个全面、可测试的定义。

AGI 定义的量化框架:GPT-4 和 GPT-5 的「差等生」表现  通用人工智能 认知能力 GPT-4 第1张

  • 论文标题:A Definition of AGI
  • 论文链接:https://www.agidefinition.ai/paper.pdf

文章提供了一个全面、可量化的框架,试图消除这些模糊性。其框架旨在明确:AGI 是一种能够匹敌甚至超越受过良好教育的成年人的认知多功能性和熟练程度的人工智能。

这一定义强调,通用智能不仅需要在狭窄领域内展现专业化的表现,还需要具备人类认知技能的广度(多功能性)和深度(熟练程度)。

以人类为镜:量化 AGI 的框架

为了实践这一定义,我们必须关注通用智能的唯一现存范例:人类。人类的认知是一个由进化磨练出的众多独特能力构成的复杂体系。这些能力赋予了我们非凡的适应能力和对世界的理解力。

为了系统地研究 AI 系统是否具备这种能力范围,该研究以卡特尔 - 霍恩 - 卡罗尔 (CHC) 认知能力理论为基础。该理论是人类智力最经实证验证的模型。CHC 理论将一般智力分解为不同的广义能力和众多狭义能力(例如归纳、联想记忆或空间扫描)。

为了确定人工智能是否具备与受过良好教育的成年人一样的认知多样性和熟练程度,该研究使用了用于测试人类的认知测试系统来测试人工智能系统。这种方法用具体的测量指标取代了模糊的智力概念,从而得出了标准化的「通用智力指数」(AGI)分数(0% 到 100%)。

AGI 定义的量化框架:GPT-4 和 GPT-5 的「差等生」表现  通用人工智能 认知能力 GPT-4 第2张

AGI 的十大核心能力

该框架包含十项核心认知分量,它们源自 CHC 理论中的「广义能力」,并被等量加权(每项 10%),以强调广度并覆盖主要的认知领域。

下图展示了这些分量及各自更细分的一些领域方向:

AGI 定义的量化框架:GPT-4 和 GPT-5 的「差等生」表现  通用人工智能 认知能力 GPT-4 第3张

值得注意的是,该团队还评估了每个分量下,当前的 GPT-4 和 GPT-5 模型的表现。

讨论

「锯齿状」AI 能力与关键瓶颈

研究发现,当代 AI 系统的认知结构呈现出高度不均衡,呈现所谓「锯齿状」(jagged)特征。

如果将智能比作引擎

研究团队将智能的多维度理解类比为一个高性能引擎。其中,整体智力水平相当于「马力」。图 3 展示了解各能力间的关系。

AGI 定义的量化框架:GPT-4 和 GPT-5 的「差等生」表现  通用人工智能 认知能力 GPT-4 第4张