谁能预料?
在视觉推理领域,大模型的表现还远不如一个三岁孩童。
根据UniPat AI、xbench、阿里、月之暗面、阶跃星辰等多家研究机构的最新研究,
在BabyVision视觉推理benchmark测试中,当前表现最佳的Gemini 3 Pro Preview也仅略胜三岁儿童一筹,与六岁儿童相比仍有20%的差距。
与成年人94.1的准确率相比,更是相差甚远。
更为关键的是,Gemini 3 Pro Preview已经算是当前模型中的佼佼者。
其他前沿模型,包括GPT-5.2、Claude 4.5 Opus、Grok-4等,整体表现甚至不如三岁小孩。
这一令人扎心的结论,无疑给当前基于VLA(M)的具身智能泼了一盆冷水。
毕竟,一个视觉能力尚未达到三岁儿童水平的AI,很难在真实物理世界中稳定、安全地协助人类。
BabyVision的研究也给出了另一种视角:
要真正推进多模态智能,未来的模型必须从底层重建视觉能力,而非继续依赖将视觉问题转化为语言来“绕行”。
在完整的评估中,研究对比了开源和闭源模型的表现:
在闭源模型中,Gemini 3-Pro-Preview以49.7%的得分领先,其次是GPT-5.2 (34.4%)和豆包-Seed-1.8 (30.2%)。
其余模型表现不佳:Qwen3-VL-Plus 19.2%,Grok-4 16.2%,Claude-4.5-Opus 14.2%。
在开源模型中,表现最好的是Qwen3VL-235B-Thinking,总分达到22.2%。
其中,Qwen3VL的Thinking版本优于Instruct版本,这表明显示显式推理能减轻视觉不确定性。
此外,即使是最大的开源模型,仍无法与顶尖闭源系统匹敌。
问题出现了。
为什么能在HLE、IMO等高难度任务中展现博士级“智商”,甚至能解数学难题的大模型,却会在一些看似简单的“找不同”任务中频频翻车?
结论:当前的多模态大模型通常先将视觉输入转化为语言表征来处理。
这种做法充分利用了大型语言模型的强大推理能力,但也引入了一个根本性的限制:
无法被语言准确表达的视觉信息,都会在这一过程中丢失。
“不可描述”的视觉特征构成了BABYVISION任务的核心难点。
本文由主机测评网于2026-06-14发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647463.html