在过去的两年里,大模型的推理能力实现了显著的飞跃。在应对数学、逻辑和多步规划等复杂任务时,诸如OpenAI的o系列、DeepSeek-R1和QwQ-32B等推理模型,已经稳定地超越了传统指令微调模型。直观来看,它们似乎只是思考得更久:更长的Chain-of-Thought和更高的test-time compute成为最常引用的解释。
然而,如果我们深入探讨:推理能力的本质,真的只是多算几步吗?
谷歌、芝加哥大学等机构的研究者最近发表的一篇论文给出了一个更具结构性的答案。他们发现,推理能力的提升并非仅源于计算步数的增加,而是源于模型在推理过程中隐式模拟了一种复杂的、类多智能体的交互结构,他们称之为“思维社会”(society of thought)。
简单来说,这项研究发现,为了解答难题,推理模型有时会模拟不同角色之间的内部对话,就像他们数字大脑中的辩论队一样。他们争论、纠正对方、表达惊讶,并调和不同观点以达成正确答案。人类智能很可能是因为社交互动而进化的,而类似的直觉也适用于人工智能!
通过对推理输出进行分类以及结合作用于推理轨迹的机制可解释性方法,研究发现,诸如DeepSeek-R1和QwQ-32B等推理模型,相较于基线模型和仅进行指令微调的模型,展现出显著更高的视角多样性。在推理过程中,它们会激活更广泛、异质性更强的、与人格和专业知识相关的特征,并在这些特征之间产生更充分的冲突。
这种类多智能体的内部结构具体表现为一系列对话式行为,包括提问—回答序列、视角切换以及对冲突观点的整合;同时还体现在刻画激烈往返互动的社会情绪角色之中。这些行为通过直接与间接两种路径,共同促进了关键认知策略的运作,从而解释了推理任务中准确率优势的来源。
进一步的受控强化学习实验显示,即便仅以推理准确率作为奖励信号,基础模型也会自发地增加对话式行为;而在训练中引入对话式脚手架(conversational scaffolding),相较于未微调的基础模型以及采用独白式推理微调的模型,能够显著加速推理能力的提升。
这些结果表明,思维的社会化组织形式有助于对解空间进行更高效的探索。谷歌认为,推理模型在计算层面建立了一种与人类群体中的集体智能相对应的机制:在结构化的条件下,多样性能够带来更优的问题求解能力。
基于此,谷歌提出了通过智能体组织形式来系统性利用“群体智慧”的新研究方向。
论文地址:https://arxiv.org/pdf/2601.10825
同时,这一研究也给社区提供了一些启发。
本研究采用Gemini-2.5-Pro模型作为评估器的方法,从推理轨迹中识别出四类对话行为:
本研究基于Bales互动过程分析(IPA)框架对推理轨迹中社会情感角色的呈现情况展开分析。该框架将话语划分为12种互动角色类型。以Gemini-2.5-Pro模型构建的LLM-as-judge评估器分别统计这12类角色的独立出现次数;在核心分析环节,作者将这些统计结果进一步归总为四大高阶类别。
本研究采用Gemini-2.5-Pro作为LLM-as-judge评估器,识别出四类此前已被证实对语言模型推理准确率存在影响的认知行为。
为探究会话行为在推理过程中发挥的作用,作者采用稀疏自编码器(SAE),对模型激活空间内具有可解释性的特征进行识别与操控。本研究使用的稀疏自编码器基于DeepSeek-R1-Llama-8B模型第15层的残差流激活值训练得到。
本文由主机测评网于2026-06-15发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647618.html