当前位置:首页 > 科技资讯 > 正文

零数据自我进化:Dr. Zero框架引领AI性能新突破

自进化智能体(Agent)领域迎来了新的里程碑。

近期,Meta超级智能实验室携手伊利诺伊大学厄巴纳-香槟分校(UIUC)共同推出了Dr. Zero框架,使Agent能在无训练数据的情况下实现高效自我进化

该框架有效解决了多轮搜索Agent在无数据自我进化中面临的“问题多样性受限”“多步推理与工具使用需大量计算资源”等难题。

研究团队创新性地提出了“跳步分组相对策略优化”(HRPO)方法,通过聚类结构相似的问题构建鲁棒的群组级基准,在保障训练效率的同时,避免了自我进化过程中昂贵的嵌套采样需求。

实验结果显示,在复杂问答任务中,该框架无需人工标注数据,性能便超越了全监督基线高达14.1%,充分展示了搜索增强模型在高级推理任务中的巨大潜力

此外,在完全缺乏人类标注数据的情况下,通过合理的架构设计与奖励机制,智能体能够自发涌现出复杂的推理与搜索能力,为数据稀缺环境下的模型训练问题提供了全新思路。

AI自我进化的数据稀缺挑战

训练强大模型通常需要海量且高质量的人工标注数据,尤其是在复杂推理和多步搜索任务中,获取精准标注数据耗时且成本高昂。尽管“自适应语言智能体”概念已提出多年,旨在通过迭代学习提升性能,但现有主流方法仍难以实现真正的自我进化。它们严重依赖人类精心编写的大量问题或标签作为提示来驱动探索,这种依赖限制了AI探索未知边界的能力。

为突破这一局限,学界开始探索无数据自我进化,即让模型自主生成问题并求解,从而构建合成训练数据。然而,从实验室走向真实应用也面临巨大挑战。

理想的自我进化框架能让AI在无任何标注数据集的情况下,通过提议者-解决者协同进化(proposer-solver co-evolution)实现性能的螺旋式上升。

零数据自我进化:Dr. Zero框架引领AI性能新突破 Dr.Zero 自我进化 零训练数据 AI性能 第1张

图 | 自适应训练框架(Huang等,2025a),通过最小化监督迭代训练提议者和解决者。

目前,自我进化研究多集中在数学、编程等定义明确、规则封闭的特定领域。尽管在这些领域模型能取得不错进展,但进入开放领域后情况截然不同。模型倾向于生成简单的单跳问题,缺乏挑战性。进行多步推理和使用搜索工具需要巨大计算资源,若通过大量盲目试错优化,计算开销将难以承受。

因此,如何让AI在复杂的开放世界中既不依赖人工数据又能高效进行高质量的自我进化,正是Dr.Zero试图解决的核心难题。

Dr.Zero:“零数据”自我进化学习系统

Dr.Zero不仅是一个模型,更是一个能够自我完善的学习系统。其核心设计包含以下三个方面:

1. 提议者-解决者协同进化

框架内包含两个核心角色——提议者(proposer)和解决者(solver),均由大型语言模型担任并在训练过程中协同进化。

零数据自我进化:Dr. Zero框架引领AI性能新突破 Dr.Zero 自我进化 零训练数据 AI性能 第2张

图|Dr. Zero自我进化反馈循环。在解决者反馈的引导下,提议者合成可验证且具有挑战性的查询,不断增强解决者的搜索与推理能力。

提议者的任务是生成多样化且结构复杂的题目,并利用外部搜索引擎主动探索开放领域信息。随着训练进行,提议者根据奖励优化自身策略,生成更复杂但可验证的新问题。

解决者的任务是尝试利用外部搜索引擎获取信息并回答问题。它基于提议者生成的合成问题进行训练,不断优化推理逻辑和搜索工具使用能力。随着解决者水平的提升,它会倒逼提议者寻找更刁钻的角度生成新问题。

零数据自我进化:Dr. Zero框架引领AI性能新突破 Dr.Zero 自我进化 零训练数据 AI性能 第3张

图|Dr. Zero中提议者与解决者迭代奖励动态的演变过程。基线奖励值随迭代不断下降,反映了模型间的协同进化:当某一模型性能提升时,会自然降低另一模型的初始奖励阈值,从而通过强化学习机制推动其持续自我优化。

2. 跳步分组相对策略优化

在让AI自我进化时,最大的阻碍通常是算力。传统的强化学习方法(如GRPO)为准确评估一个问题的好坏需进行“嵌套采样”。HRPO巧妙地解决了这一问题。

传统方法计算量大且面对结构多样的开放问题时全局基准评估不稳定。HRPO将结构相似的问题(如按推理步骤的“跳数”复杂度)进行聚类构建组级基准。这意味着模型无需对每个提示都生成许多重复问题测试只需每个提示生成单个问题通过与同组内其他问题的表现对比就能获得稳健的评估结果。这直接避免了昂贵的嵌套采样在保证训练效果的同时大幅降低了计算成本。

3. 难度引导奖励机制

为激励提出者生成高质量难题Dr.Zero采用了一套精细的难度引导奖励机制。

该机制设计鼓励提出者生成复杂、多跳、有难度但可通过搜索引擎验证的查询而不仅仅是简单的单跳问题。它不仅鼓励问题具有挑战性同时确保问题的答案可通过搜索引擎返回的信息进行客观验证避免生成无法评估的开放或主观问题。

Dr.Zero作为一个可扩展且高效的框架通过无数据自进化迭代提升提议者和求解者。每次迭代中提议者会生成一批具有异构跳转结构的问答对。利用求解者反馈提议者通过HRPO优化生成可验证、多样化且具有挑战性的查询。同时求解者通过GRPO利用生成的数据提升搜索和推理能力。这种交替优化循环形成了共生反馈机制:随着求解者能力提升简单查询的回报逐渐递减迫使提议者探索更复杂的推理路径以最大化收益。

“零数据”进化超越“有数据”监督

为全面评估Dr.Zero的搜索与推理能力实验涵盖了开放域问答中的多种场景构建了覆盖广泛的基准测试体系.

其中包含单跳任务如NQ (Natural Questions)、TriviaQA等测试模型基于单一事实的精准检索与回答能力;以及多跳复杂任务如HotpotQA、MuSiQue、2WikiMQA等要求模型进行多轮搜索、信息综合与连贯推理对智能体的交互与深层理解能力提出极高挑战。

零数据自我进化:Dr. Zero框架引领AI性能新突破 Dr.Zero 自我进化 零训练数据 AI性能 第4张

图 | 接受不同生成问题分布训练的Dr. Zero性能表现。

实验结论如下:

1. 性能媲美甚至超越监督基线

- Dr. Zero经过多轮自我进化后在多个开放领域问答基准上的表现与使用人工标注数据训练的全监督搜索智能体基线(如Search-R1)相当或更优。例如部分任务上实现了最高14.1%的性能提升实验结果证明了无数据进化所达到的性能水平是可靠且鲁棒的。

- 远超其他无数据基线

- 与现有无数据方法(如自问式语言模型SQLM和自进化推理模型R-Zero)相比Dr. Zero在所有任务中均表现最佳性能平均分别超越SQLM和R-Zero达39.9%和27.3%。这尤其在复杂多跳任务上Dr. Zero通过其难度引导奖励生成的问题使性能较优化后的R-Zero*平均提升83.3%凸显了其在促进复杂推理能力方面的独特优势。

- 规模效应显著验证框架可扩展性

- 研究团队还观察到了明确的模型规模效应。7B参数规模的模型在如2WikiMQA等复杂的多跳推理数据集上表现尤为突出实现了显著的相对提升(7.67%)。这表明Dr. Zero框架具有良好的可扩展性更大规模的模型能更有效地利用该自进化机制处理更复杂、交织度更高的搜索与推理任务。