当前位置:首页 > 科技资讯 > 正文

视觉推理挑战:大模型仍显稚嫩

谁能预料?

在视觉推理领域,大模型的表现还远不如一个三岁孩童。

根据UniPat AI、xbench、阿里、月之暗面、阶跃星辰等多家研究机构的最新研究,

BabyVision视觉推理benchmark测试中,当前表现最佳的Gemini 3 Pro Preview也仅略胜三岁儿童一筹,与六岁儿童相比仍有20%的差距。

视觉推理挑战:大模型仍显稚嫩 视觉推理 大模型 多模态 生成模型 第1张

与成年人94.1的准确率相比,更是相差甚远。

视觉推理挑战:大模型仍显稚嫩 视觉推理 大模型 多模态 生成模型 第2张

更为关键的是,Gemini 3 Pro Preview已经算是当前模型中的佼佼者。

其他前沿模型,包括GPT-5.2Claude 4.5 OpusGrok-4等,整体表现甚至不如三岁小孩。

视觉推理挑战:大模型仍显稚嫩 视觉推理 大模型 多模态 生成模型 第3张

这一令人扎心的结论,无疑给当前基于VLA(M)的具身智能泼了一盆冷水。

毕竟,一个视觉能力尚未达到三岁儿童水平的AI,很难在真实物理世界中稳定、安全地协助人类。

BabyVision的研究也给出了另一种视角:

要真正推进多模态智能,未来的模型必须从底层重建视觉能力,而非继续依赖将视觉问题转化为语言来“绕行”。

视觉推理的语言化瓶颈

在完整的评估中,研究对比了开源和闭源模型的表现:

视觉推理挑战:大模型仍显稚嫩 视觉推理 大模型 多模态 生成模型 第4张

在闭源模型中,Gemini 3-Pro-Preview以49.7%的得分领先,其次是GPT-5.2 (34.4%)和豆包-Seed-1.8 (30.2%)。

其余模型表现不佳:Qwen3-VL-Plus 19.2%,Grok-4 16.2%,Claude-4.5-Opus 14.2%。

在开源模型中,表现最好的是Qwen3VL-235B-Thinking,总分达到22.2%

其中,Qwen3VL的Thinking版本优于Instruct版本,这表明显示显式推理能减轻视觉不确定性。

此外,即使是最大的开源模型,仍无法与顶尖闭源系统匹敌。

问题出现了。

为什么能在HLE、IMO等高难度任务中展现博士级“智商”,甚至能解数学难题的大模型,却会在一些看似简单的“找不同”任务中频频翻车?

结论:当前的多模态大模型通常先将视觉输入转化为语言表征来处理。

这种做法充分利用了大型语言模型的强大推理能力,但也引入了一个根本性的限制:

无法被语言准确表达的视觉信息,都会在这一过程中丢失。

视觉推理挑战:大模型仍显稚嫩 视觉推理 大模型 多模态 生成模型 第5张

非言语性精细细节的缺失

“不可描述”的视觉特征构成了BABYVISION任务的核心难点。

流形一致性(Manifold Identity)的丢失

空间想象力

视觉模式归纳

基于RLVR与生成式建模的视觉推理

(一) RLVR

(二) 生成模型方法

(三) 研究趋势:将生成模型转化为原生多模态推理器