顶尖AI模型在通过医学考试、编写代码和数学竞赛中展现非凡能力,却在儿童游戏《宝可梦》中频频受挫。
这场引人瞩目的尝试始于2025年2月,Anthropic研究人员通过Twitch直播展示了“Claude玩《宝可梦红》”,以配合Claude Sonnet 3.7的发布。
直播间涌入2000名观众,他们为Claude出谋划策,使这场直播成为公开观察AI能力的窗口。
尽管Sonet3.7能“玩”《宝可梦》,但“会玩”不等于“能赢”。它会在关键节点卡住数十小时,还会犯连儿童玩家都不会犯的低级错误。
这并非Claude首次尝试。
早期版本表现更糟糕:有的毫无目标地游荡,有的陷入无限循环,更多甚至无法走出新手村。
即便Claude Opus 4.5能力显著提升,仍会犯令人费解的失误。例如,它在“道馆外”绕圈四天,却未意识到需要砍倒挡在路口的树。
为何一款儿童游戏成为AI的滑铁卢?
因为《宝可梦》要求的能力正是AI最缺乏的:在没有明确指令的开放世界中持续推理、记忆数小时前的决策、理解隐含的因果关系、在数百个可能的行动中做出长期规划。
这些事情对8岁孩子来说轻而易举,却成为AI模型的鸿沟。
相比之下,谷歌的Gemini 2.5 Pro在2025年5月成功通关难度相当的《宝可梦》游戏。谷歌首席执行官桑达尔·皮查伊甚至在公开场合表示,公司迈出了打造“人工宝可梦智能”的一步。
然而,这一结果并非简单归因于Gemini模型更“聪明”。
关键差异在于模型使用的工具集。独立开发者乔尔·张将工具集比喻为“钢铁侠装甲”:AI并非赤手空拳,而是被置于可调用多种外部能力的系统中。
Gemini的工具集提供更多支持,如将游戏画面转写为文本,弥补视觉理解弱点,并提供解谜与路径规划工具。相比之下,Claude的工具集更简约,直接反映模型在感知、推理与执行上的真实能力。
在日常任务中,这种差异不明显。但在《宝可梦》这类长期任务中,工具集差异被放大至决定成败的程度。
由于《宝可梦》采用严格的回合制且无需即时反应,它成为测试AI的绝佳“练兵场”。
AI在每一步操作中只需结合当前画面、目标提示与可选操作进行推理,输出明确指令。这似乎正是大语言模型擅长的交互形式。
症结在于时间维度的“断层”。尽管Claude Opus 4.5已运行超500小时、执行约17万步,但受限于每一步后的重新初始化,只能在极窄的上下文窗口中寻找线索。这种机制让它像靠便利贴维持认知的失忆者,在碎片化的信息中循环往复,始终无法像人类玩家那样实现质变。
尽管如此,AI的进步仍清晰可见。Claude Opus 4.5在自我记录和视觉理解上优于前代,能在游戏中推进更远。Gemini 3 Pro在通关《宝可梦蓝》后完成难度更高的《宝可梦水晶》,且未输一场战斗。这是Gemini 2.5 Pro未能实现的。
与此同时,Anthropic推出的Claude Code工具集允许模型编写并运行自有代码,已被用于《过山车大亨》等复古游戏,成功管理虚拟主题公园。
这些案例揭示一个不直观的现实:配备合适工具集的AI可能在软件开发、会计、法律分析等知识工作中展现极高效率,即便仍难以应对需要实时反应的任务。
《宝可梦》并非孤例。在追求通用人工智能(AGI)的道路上,开发者发现AI在复杂游戏中仍面临难以逾越的挑战。
本文由主机测评网于2026-06-15发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647583.html