北京时间12月21日,AI界巨头OpenAI的精英成员、AI巨擘安德烈·卡帕西(Andrej Karpathy)发布了题为《2025大语言模型年度回顾》的年度深度观察报告。
在报告中,卡帕西详尽剖析了过去一年大语言模型(LLM)领域的底层范式转变。他指出,2025年标志着AI训练哲学从单纯的“概率模仿”迈向“逻辑推理”的决定性飞跃。
这一转变的核心动力源自可验证奖励强化学习(RLVR)的成熟,它通过数学与代码等客观反馈环境,迫使模型自发产生类似人类思维的“推理痕迹”。卡帕西认为,这种长期强化学习已开始侵蚀传统预训练份额,成为提升模型能力的新引擎。
除了技术路径的迭代,卡帕西还深刻探讨了智能的本质。他用“召唤幽灵”(Summoning Ghosts)而非“进化动物”(Evolving/growing Animals)来比喻当前AI的成长模式,解释了为何当前大语言模型会展现出“锯齿状”性能特征——在尖端领域如天才般出色,却在基础常识上可能如孩童般脆弱。
此外,卡帕西也详述了“氛围编程(Vibe Coding)”的兴起、本地化智能体的实用化趋势,以及大语言模型图形界面(LLM GUI)的演进。他强调,尽管行业迅猛发展,但人类目前对这一新计算范式潜力的挖掘尚不足10%,未来发展空间依旧极其广阔。
卡帕西揭示了一个冷酷却充满希望的现实:我们正站在从“模拟人类智能”向“纯粹机器智能”跨越的临界点。随着RLVR等技术的普及,2026年的AI竞争将不再局限于算力的军备竞赛,而是转向对“如何让AI高效思考”这一核心逻辑范式的深度挖掘。
以下为卡帕西年度回顾全文:
《2025大语言模型年度回顾》
2025年是大语言模型领域大步跨越且充满变数的一年。以下是我认为值得特别记录、且在某种程度上出人意料的‘范式偏移(Paradigm Shifts)’清单。它们深刻改变了行业景观,并在思维层面带来了极大冲击。
在2025年初,所有实验室的大语言模型生产堆栈基本如下:
预训练(Pretraining, 2020年的GPT-2/3)
监督微调(SFT, 2022年的InstructGPT)
基于人类反馈的强化学习 (RLHF, 2022年)
长期以来,这一直是训练生产级大语言模型的稳定且经实践验证的方案。而到了2025年,基于可验证奖励的强化学习脱颖而出,成为该技术组合中事实上的核心新阶段。
...(内容保持原样)
本文由主机测评网于2026-05-30发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260546757.html