在一次访谈中,图灵奖得主 Richard Sutton 发表了惊人言论:大语言模型(LLM)是误入歧途的起点。
在 Sutton 看来,真正的智能源自经验学习,通过行动、观察与反馈持续调整行为,实现目标;相比之下,大语言模型的预测能力更多是对人类行为的模仿,它没有独立目标,也无法对外部世界的变化做出真正的响应和调整。
他认为,想要实现真正可扩展的智能,必须从经验学习出发,而非以大语言模型为起点。
这一观点无疑在当下的大模型热潮中,为我们打了一剂清醒剂,促使我们重新审视智能的本质与基础。
此次 Sutton 与科技博主 Dwarkesh Patel 的对话非常精彩,充满观点碰撞。访谈内容包括以下 7 个部分:
完
学术头条节选了该访谈的第一部分内容「Are LLMs a dead end?」,在不改变原文大意的前提下,做了一定的编辑。如下:
Dwarkesh Patel:Richard Sutton 是强化学习的奠基人之一,也是许多主要技术的发明者。凭借这些贡献,他获得了今年的图灵奖。Richard,恭喜。
Richard Sutton:谢谢,Dwarkesh。
Dwarkesh Patel:我的第一个问题是:我和听众更多是从大语言模型(LLM)的角度思考 AI。如果从强化学习(RL)的角度理解 AI,我们可能错过了什么?
Richard Sutton:这确实是一个非常不同的视角。两者常被割裂,失去对话能力。大语言模型如今很火,但我们的领域容易被潮流带偏,忽视根本问题。我认为,强化学习才是真正的基础 AI。
智能是什么?是对所处世界的理解。强化学习关注理解世界,而大语言模型更多在模仿人类。它们不是在思考“应该做什么”。
Dwarkesh Patel:有人认为模仿学习能为模型提供先验知识,让它们具备合理解决问题的能力。您认同吗?
Richard Sutton:不。这观点基于大语言模型,但我认为这不是好观点。要成为先验,必须有真实存在的东西。先验知识应是实际知识的基础。在大语言模型中,没有实际知识的定义。
真正重要的是持续学习。“持续”意味着在正常交互中不断学习。而在正常互动中,必须有判断正确的方式。
在大语言模型的设置中,没有判断正确表达的方式。它们没有目标。所以一句话和另一句话没有对错之分。
Dwarkesh Patel:有人认为模仿学习能为基础注入先验知识。您怎么看?
Richard Sutton:没有目标,就不可能有先验知识。因为先验知识是关于真相的提示或初始信念。世间没有绝对真理或正确言论。在强化学习中,有正确的事要做,正确的事就是能获得奖励的事。
Dwarkesh Patel:在大语言模型之上做强化学习不是可行方向吗?毕竟它们能在国际数学奥林匹克竞赛上拿金牌。
Richard Sutton:数学问题不同。经验世界必须通过交互学习,从结果中得到反馈。而数学偏向计算,目标清晰:找到证明。
Dwarkesh Patel:大语言模型没有吸取“苦涩的教训”?
Richard Sutton:大语言模型是否算“苦涩的教训”的案例?它们利用大规模计算的方法,这种计算可以随数据扩展。但它们也是融入大量人类知识的方式。这是值得探讨的问题。
Dwarkesh Patel:那么,真正可扩展的方法是什么?
Richard Sutton:从经验中学习。尝试各种做法,观察哪些有效。前提是有一个目标。
本文由主机测评网于2026-05-02发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260542073.html