当前位置:首页 > 科技资讯 > 正文

AI在《宝可梦》中遇挑战,揭示通用智能的局限

顶尖AI模型在通过医学考试、编写代码和数学竞赛中展现非凡能力,却在儿童游戏《宝可梦》中频频受挫。

这场引人瞩目的尝试始于2025年2月,Anthropic研究人员通过Twitch直播展示了“Claude玩《宝可梦红》”,以配合Claude Sonnet 3.7的发布。

直播间涌入2000名观众,他们为Claude出谋划策,使这场直播成为公开观察AI能力的窗口。

尽管Sonet3.7能“玩”《宝可梦》,但“会玩”不等于“能赢”。它会在关键节点卡住数十小时,还会犯连儿童玩家都不会犯的低级错误。

这并非Claude首次尝试。

早期版本表现更糟糕:有的毫无目标地游荡,有的陷入无限循环,更多甚至无法走出新手村。

即便Claude Opus 4.5能力显著提升,仍会犯令人费解的失误。例如,它在“道馆外”绕圈四天,却未意识到需要砍倒挡在路口的树。

为何一款儿童游戏成为AI的滑铁卢?

因为《宝可梦》要求的能力正是AI最缺乏的:在没有明确指令的开放世界中持续推理、记忆数小时前的决策、理解隐含的因果关系、在数百个可能的行动中做出长期规划。

这些事情对8岁孩子来说轻而易举,却成为AI模型的鸿沟。

01

工具集差距决定成败?

相比之下,谷歌的Gemini 2.5 Pro在2025年5月成功通关难度相当的《宝可梦》游戏。谷歌首席执行官桑达尔·皮查伊甚至在公开场合表示,公司迈出了打造“人工宝可梦智能”的一步。

然而,这一结果并非简单归因于Gemini模型更“聪明”。

关键差异在于模型使用的工具集。独立开发者乔尔·张将工具集比喻为“钢铁侠装甲”:AI并非赤手空拳,而是被置于可调用多种外部能力的系统中。

Gemini的工具集提供更多支持,如将游戏画面转写为文本,弥补视觉理解弱点,并提供解谜与路径规划工具。相比之下,Claude的工具集更简约,直接反映模型在感知、推理与执行上的真实能力。

在日常任务中,这种差异不明显。但在《宝可梦》这类长期任务中,工具集差异被放大至决定成败的程度。

02

回合制暴露AI的“长期记忆”短板

由于《宝可梦》采用严格的回合制且无需即时反应,它成为测试AI的绝佳“练兵场”。

AI在每一步操作中只需结合当前画面、目标提示与可选操作进行推理,输出明确指令。这似乎正是大语言模型擅长的交互形式。

症结在于时间维度的“断层”。尽管Claude Opus 4.5已运行超500小时、执行约17万步,但受限于每一步后的重新初始化,只能在极窄的上下文窗口中寻找线索。这种机制让它像靠便利贴维持认知的失忆者,在碎片化的信息中循环往复,始终无法像人类玩家那样实现质变。

03

能力演进背后:未跨越的“本能”鸿沟

尽管如此,AI的进步仍清晰可见。Claude Opus 4.5在自我记录和视觉理解上优于前代,能在游戏中推进更远。Gemini 3 Pro在通关《宝可梦蓝》后完成难度更高的《宝可梦水晶》,且未输一场战斗。这是Gemini 2.5 Pro未能实现的。

与此同时,Anthropic推出的Claude Code工具集允许模型编写并运行自有代码,已被用于《过山车大亨》等复古游戏,成功管理虚拟主题公园。

这些案例揭示一个不直观的现实:配备合适工具集的AI可能在软件开发、会计、法律分析等知识工作中展现极高效率,即便仍难以应对需要实时反应的任务。

04

AI难以逾越的“数字长征”,远不止《宝可梦》

《宝可梦》并非孤例。在追求通用人工智能(AGI)的道路上,开发者发现AI在复杂游戏中仍面临难以逾越的挑战。

AI在《宝可梦》中遇挑战,揭示通用智能的局限 AI挑战 通用智能 工具集差距 长期记忆 第1张

AI在《宝可梦》中遇挑战,揭示通用智能的局限 AI挑战 通用智能 工具集差距 长期记忆 第2张

......