当前位置:首页 > 科技资讯 > 正文

大模型推理跃迁:类多智能体交互结构揭示

在过去的两年里,大模型的推理能力实现了显著的飞跃。在应对数学、逻辑和多步规划等复杂任务时,诸如OpenAI的o系列、DeepSeek-R1和QwQ-32B等推理模型,已经稳定地超越了传统指令微调模型。直观来看,它们似乎只是思考得更久:更长的Chain-of-Thought和更高的test-time compute成为最常引用的解释。

然而,如果我们深入探讨:推理能力的本质,真的只是多算几步吗?

谷歌、芝加哥大学等机构的研究者最近发表的一篇论文给出了一个更具结构性的答案。他们发现,推理能力的提升并非仅源于计算步数的增加,而是源于模型在推理过程中隐式模拟了一种复杂的、类多智能体的交互结构,他们称之为“思维社会”(society of thought)。

简单来说,这项研究发现,为了解答难题,推理模型有时会模拟不同角色之间的内部对话,就像他们数字大脑中的辩论队一样。他们争论、纠正对方、表达惊讶,并调和不同观点以达成正确答案。人类智能很可能是因为社交互动而进化的,而类似的直觉也适用于人工智能!

大模型推理跃迁:类多智能体交互结构揭示 大模型 推理跃迁 类多智能体 思维社会 第1张

通过对推理输出进行分类以及结合作用于推理轨迹的机制可解释性方法,研究发现,诸如DeepSeek-R1和QwQ-32B等推理模型,相较于基线模型和仅进行指令微调的模型,展现出显著更高的视角多样性。在推理过程中,它们会激活更广泛、异质性更强的、与人格和专业知识相关的特征,并在这些特征之间产生更充分的冲突。

这种类多智能体的内部结构具体表现为一系列对话式行为,包括提问—回答序列、视角切换以及对冲突观点的整合;同时还体现在刻画激烈往返互动的社会情绪角色之中。这些行为通过直接与间接两种路径,共同促进了关键认知策略的运作,从而解释了推理任务中准确率优势的来源。

进一步的受控强化学习实验显示,即便仅以推理准确率作为奖励信号,基础模型也会自发地增加对话式行为;而在训练中引入对话式脚手架(conversational scaffolding),相较于未微调的基础模型以及采用独白式推理微调的模型,能够显著加速推理能力的提升。

这些结果表明,思维的社会化组织形式有助于对解空间进行更高效的探索。谷歌认为,推理模型在计算层面建立了一种与人类群体中的集体智能相对应的机制:在结构化的条件下,多样性能够带来更优的问题求解能力。

基于此,谷歌提出了通过智能体组织形式来系统性利用“群体智慧”的新研究方向。

大模型推理跃迁:类多智能体交互结构揭示 大模型 推理跃迁 类多智能体 思维社会 第2张

论文地址:https://arxiv.org/pdf/2601.10825

同时,这一研究也给社区提供了一些启发。

方法概览

对话行为

本研究采用Gemini-2.5-Pro模型作为评估器的方法,从推理轨迹中识别出四类对话行为:

  • 问答行为:指对话中先提出问题后给出回答的语列。
  • 视角转换:指对话过程中切换至新的想法、观点、假设或分析方法的行为。
  • 观点冲突:指表达出与其他观点不一致、纠正对方观点或观点间存在矛盾张力的情况。
  • 观点调和:指将存在冲突的观点整合或梳理为连贯结论的情形。

社会情感角色

本研究基于Bales互动过程分析(IPA)框架对推理轨迹中社会情感角色的呈现情况展开分析。该框架将话语划分为12种互动角色类型。以Gemini-2.5-Pro模型构建的LLM-as-judge评估器分别统计这12类角色的独立出现次数;在核心分析环节,作者将这些统计结果进一步归总为四大高阶类别。

  • 信息给予类角色:包括提出建议、表达观点、提供导向。
  • 信息征询类角色:包括征询建议、征询观点、征询导向。
  • 积极情感类角色:包括展现团结、释放紧张、表示认同。
  • 消极情感类角色:包括表现对抗、显露紧张、表示异议。

认知行为

本研究采用Gemini-2.5-Pro作为LLM-as-judge评估器,识别出四类此前已被证实对语言模型推理准确率存在影响的认知行为。

  • 结果核验:指推理链中明确将当前推导结果与目标答案进行比对的情形。
  • 路径回溯:指模型意识到当前推理路径无法得到正确结果,进而明确返回并尝试其他方法的情形。
  • 子目标拆解:指模型将原问题分解为若干更小、可分步完成的中间目标的情形。
  • 逆向推理:指模型从目标答案出发,反向推导至初始问题的情形。

特征干预

为探究会话行为在推理过程中发挥的作用,作者采用稀疏自编码器(SAE),对模型激活空间内具有可解释性的特征进行识别与操控。本研究使用的稀疏自编码器基于DeepSeek-R1-Llama-8B模型第15层的残差流激活值训练得到。

大模型推理跃迁:类多智能体交互结构揭示 大模型 推理跃迁 类多智能体 思维社会 第3张

实验结果

对话行为和社会情感角色

大模型推理跃迁:类多智能体交互结构揭示 大模型 推理跃迁 类多智能体 思维社会 第4张

对话特征引导可提升推理准确率

大模型推理跃迁:类多智能体交互结构揭示 大模型 推理跃迁 类多智能体 思维社会 第5张