春节的喜庆尚未散去,科技界已掀起新一轮竞争热潮:从红包大战到奶茶豪礼,无不预示着市场的不凡。这背后的预算虽仅30个小目标,却足以激起波澜。
资金在前线燃烧,基础设施紧随其后,因为当推广预算耗尽,真正考验产品留存的,便是其自身的品质。在此背景下,腾讯在下半年引进前OpenAI研究员、清华姚班的姚顺雨,其布局可谓深远。
姚顺雨掌舵腾讯AI后,近日发布了一项重要研究,由腾讯混元团队携手复旦大学完成,聚焦上下文处理。这一看似冷门的技术点,却揭示了一个令人震惊的事实:若将大模型从“背书模式”转向“现学现卖”,即便是当前最强的AI,其得分率也仅为23.7%。
这项研究不仅是技术圈的谈资,更直接揭示了AI在日常使用中的种种不足。若说AI有阿喀琉斯之踵,那非上下文莫属。
要理解这项研究的价值,需先了解大模型运作的两个阶段。
第一阶段是预训练,模型通过阅读海量数据,积累大量知识和模式。这是AI知识的基础,也是其回答通用问题的基石。
然而,问题在于预训练数据是静态的,反映的仅是模型训练截止前的世界。一旦脱离此范围,模型便陷入盲目。而现实世界是动态的。
于是,我们进入第二阶段——情境学习,即上下文处理。当你向AI发送全新、内部或复杂规则文本时,你实际上是在要求它跳出预训练记忆,根据眼前信息进行实时推理和判断。
比如公司内部会议纪要等新知识,从未在网上出现过,只能由你将规则、信息(即“上下文”)传递给AI,让它根据这些新知识回答问题。
这才是现实:互联网并非万能,模型对上下文的学习能力至关重要,甚至可以说:上下文就是AI的灵魂。
若AI记不住或误解上下文,便会开始编造(幻觉),可能根据“记忆”中的通用规则回答——例如会议纪要中明明说行政部负责下午茶,它却说是产品经理负责。
这就是混元团队创建CL-bench的目的。他们构建了近2000个从未公开过的、由专家精心设计的“全新情境”,包括虚构的法律体系和编程语言等。
根据CL-bench排行榜,目前最先进的GPT-5.1(High)模型正确率仅为23.7%,Claude Opus 4.5约为21.1%,其他模型大多徘徊在10%-18%之间。
这意味着,当我们要求AI“忘记以前学的,只看这段新内容”时,它们很可能搞砸。它们就像固执的学生,即便老师改了黑板上的公式,它仍会坚持旧答案,因为新知识对它而言“超纲”了。
CL-bench研究揭示了模型在情境学习中失败的深层原因,解释了AI时而聪明时而愚蠢的现象。
最常见的原因是模型在预训练中形成的东西太“根深蒂固”。当接收到新上下文时,它往往无法有效抑制预训练数据中根深蒂固的模式。
例如,在CL-bench的一个测试案例中,研究人员构建了一个虚构的软件开发包Skynet SDK。尽管是虚构的,但“Skynet(天网)”在AI的潜意识(预训练数据)中太出名了,模型可能会将《终结者》设定带入其中,从而忽视说明文档中的代码规则。
此外,复杂逻辑的推演能力仍是技术瓶颈。尽管模型能处理数万字文本,但它不一定能从海量数据中精准提取关键信息。研究发现,当上下文非常长、逻辑复杂时(如多轮交互依赖),模型表现会大幅下降。
CL-bench是姚顺雨入主腾讯后首次署名的研究成果。将其置于腾讯庞大的产品矩阵中审视,可见“上下文学习”与这家互联网巨头业务逻辑的紧密联系。
与其他更偏向搜索或通用生产力工具的科技公司不同,腾讯的根基深植于“社交”与“内容”之中。这两个领域对AI上下文能力的要求极为苛刻。
以微信或QQ为例。这里的数据不是孤立的问答,而是连绵不断、高度碎片化的对话流。当用户试图在群聊中总结重点或在私聊记录中寻找约定细节时,AI面临的挑战正是CL-bench所测试的极限:它必须精准理解封闭对话中的特定语境、人际关系和隐含逻辑。
若AI无法妥善处理高密度上下文,便无法融入十亿用户的社交链路。它只能成为打断对话流畅度的累赘。
此外,腾讯在游戏与企业服务领域的布局也决定了对“情境学习”的渴求。游戏探索AI如何根据即时操作和游戏内局势做出反应;在企业微信和腾讯会议中,用户需要的是基于特定会议纪要或私有文档的精准分析。在这些场景下,通用预训练知识不仅无效,甚至可能因“幻觉”带来误导。
本文由主机测评网于2026-07-03发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260748463.html