【新智元探索】Transformer虽被誉为AI革命之巅,但Llion Jones警告:它非终点。如同RNN被替代,当前微调研究可能仅是局部优化,而真正的AGI突破或隐藏于生物启发的全新架构中。
Transformer是AI的终极形态吗?
不,绝对没有。
那么,规模化是通往AGI的唯一路径吗?
在Transformer架构研究最久的人告诉你:不。
Sakana AI的创始人、研究科学家Llion Jones,与其他七位合著者共同发明了Transformer。
除了那七位共同作者,无人比他研究Transformer更久。
尽管如此,去年,他做出重要决定:大幅减少在Transformer上的研究投入。
并非领域无新意,而是它已拥堵不堪。
他坦言,他成了自己成功的受害者:
我不认为Transformer就是终点,也不相信我们只需无限扩大规模。
某一天,我们将再次迎来突破,回首发现,如今诸多研究其实是在浪费时间。
在Transformer出现前,RNN是主流。
RNN的确是AI历史上的重大突破。
突然,所有人都致力于改进RNN。
但结果总是对同一架构做些微调,如把门控单元换个位置,将语言建模性能提升至1.26、1.25比特每字符。
在Transformer出现后,把非常深的仅解码器Transformer应用于同一任务时,立刻达到1.1比特/字符。
于是,所有关于RNN的研究突然显得白费。
如今论文,似乎回到老路:在同一架构上,做无数微小改动——如调整normalization层位置,或略微改良训练方式。
2020年,时任谷歌DeepMind研究员Sarah Hooker提出「硬件彩票」:
通往AGI的道路不止一条,深度神经网络恰遇GPU这样的硬件彩票。
论文链接:https://hardwarelottery.github.io/
「硬件彩票」这一术语,描述了某种研究思路之所以胜出,是因为它恰好契合现有软件和硬件条件,而非在所有备选研究方向中具有普遍优越性。
而Llion Jones认为,Transformer是一种架构彩票,业界恐重蹈RNN覆辙。
哪怕已有架构在论文中表现得比Transformer好。但问题在于,新架构还不足以让整个行业放弃Transformer。
原因现实:大家对Transformer的理解已非常成熟,训练方法、微调方式、配套软件工具一应俱全。
你要大家从头换一套,除非新架构好到「碾压式胜出」,否则不可能。
Llion Jones进一步指出,目前大语言模型非通用智能,呈现「锯齿状智能」(jagged intelligence)特性。
即它们能在某些任务上表现如天才,但转眼就犯低级错误。
它刚才解出博士级问题,下一秒说出小学生都不会错的答案,这种反差刺眼。
他认为这揭示当前架构中根本性问题。
问题在于它们太「万金油」。
你可以让它们做任何事,只要训练足、调参准。
但正因为这样,我们反而忽视关键问题——「有无更好方式表示知识、思考问题」。
这是近期AI领域最坦诚言论之一。
本文由主机测评网于2026-06-12发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647114.html