当前位置:首页 > 科技资讯 > 正文

大语言模型:错误的智能起点?

大语言模型:错误的智能起点? 大语言模型 强化学习 智能 经验学习 第1张

在一次访谈中,图灵奖得主 Richard Sutton 发表了惊人言论:大语言模型(LLM)是误入歧途的起点。

在 Sutton 看来,真正的智能源自经验学习,通过行动、观察与反馈持续调整行为,实现目标;相比之下,大语言模型的预测能力更多是对人类行为的模仿,它没有独立目标,也无法对外部世界的变化做出真正的响应和调整。

他认为,想要实现真正可扩展的智能,必须从经验学习出发,而非以大语言模型为起点。

这一观点无疑在当下的大模型热潮中,为我们打了一剂清醒剂,促使我们重新审视智能的本质与基础。

此次 Sutton 与科技博主 Dwarkesh Patel 的对话非常精彩,充满观点碰撞。访谈内容包括以下 7 个部分:

  1. 大语言模型(LLMs)是死胡同吗?
  2. 人类会进行模仿学习吗?
  3. 经验时代
  4. 现有架构在分布外泛化能力差
  5. AI 领域的惊喜
  6. “苦涩的教训”在 AGI 之后仍然适用吗?
  7. AI 的接替

大语言模型:错误的智能起点? 大语言模型 强化学习 智能 经验学习 第2张

学术头条节选了该访谈的第一部分内容「Are LLMs a dead end?」,在不改变原文大意的前提下,做了一定的编辑。如下:

Dwarkesh Patel:Richard Sutton 是强化学习的奠基人之一,也是许多主要技术的发明者。凭借这些贡献,他获得了今年的图灵奖。Richard,恭喜。

Richard Sutton:谢谢,Dwarkesh。

Dwarkesh Patel:我的第一个问题是:我和听众更多是从大语言模型(LLM)的角度思考 AI。如果从强化学习(RL)的角度理解 AI,我们可能错过了什么?

Richard Sutton:这确实是一个非常不同的视角。两者常被割裂,失去对话能力。大语言模型如今很火,但我们的领域容易被潮流带偏,忽视根本问题。我认为,强化学习才是真正的基础 AI。

智能是什么?是对所处世界的理解。强化学习关注理解世界,而大语言模型更多在模仿人类。它们不是在思考“应该做什么”。

Dwarkesh Patel:有人认为模仿学习能为模型提供先验知识,让它们具备合理解决问题的能力。您认同吗?

Richard Sutton:不。这观点基于大语言模型,但我认为这不是好观点。要成为先验,必须有真实存在的东西。先验知识应是实际知识的基础。在大语言模型中,没有实际知识的定义。

真正重要的是持续学习。“持续”意味着在正常交互中不断学习。而在正常互动中,必须有判断正确的方式。

在大语言模型的设置中,没有判断正确表达的方式。它们没有目标。所以一句话和另一句话没有对错之分。

Dwarkesh Patel:有人认为模仿学习能为基础注入先验知识。您怎么看?

Richard Sutton:没有目标,就不可能有先验知识。因为先验知识是关于真相的提示或初始信念。世间没有绝对真理或正确言论。在强化学习中,有正确的事要做,正确的事就是能获得奖励的事。

Dwarkesh Patel:在大语言模型之上做强化学习不是可行方向吗?毕竟它们能在国际数学奥林匹克竞赛上拿金牌。

Richard Sutton:数学问题不同。经验世界必须通过交互学习,从结果中得到反馈。而数学偏向计算,目标清晰:找到证明。

Dwarkesh Patel:大语言模型没有吸取“苦涩的教训”?

Richard Sutton:大语言模型是否算“苦涩的教训”的案例?它们利用大规模计算的方法,这种计算可以随数据扩展。但它们也是融入大量人类知识的方式。这是值得探讨的问题。

Dwarkesh Patel:那么,真正可扩展的方法是什么?

Richard Sutton:从经验中学习。尝试各种做法,观察哪些有效。前提是有一个目标。