当前位置:首页 > 科技资讯 > 正文

测试时训练:推动大模型科学发现的新前沿

大模型持续学习又迎新突破!

斯坦福、英伟达等研究机构携手带来全新解决方案——Test-Time Training to Discover (TTT-Discover)

测试时训练:推动大模型科学发现的新前沿 测试时训练 强化学习 熵目标函数 PUCT重用策略 第1张

基于开源模型gpt-oss-120b,TTT-Discover在多个领域达成SOTA,超越人类专家及闭源前沿模型。

不同于传统“测试时缩放”仅通过Prompt调度冻结模型的方法,TTT-Discover在测试阶段针对单个具体问题,引入强化学习(RL)更新模型权重。

此“测试时训练”使模型能从失败尝试中实时获取经验,更新参数,实现定向进化。

数学领域提出Erdős最小重叠问题新界及自相关不等式;Kernel工程方面,较顶级人类工程师快2倍;算法方面,历届AtCoder比赛题目上取得最高分;生物领域,单细胞RNA-seq去噪任务上达SOTA。

测试时训练:推动大模型科学发现的新前沿 测试时训练 强化学习 熵目标函数 PUCT重用策略 第2张

测试时强化学习机制

论文核心在于测试时强化学习 (Reinforcement Learning at Test Time),体现在:

1. 学习目标(Learning Objective)

区别于传统强化学习提升所有任务“平均奖励”以实现泛化,TTT-Discover采用熵目标函数(Entropic Objective)。通过调整权重倾向于奖励最高动作而非整条轨迹,核心目标是产生极优解而非多个平庸解。

2. 搜索程序(Search Subroutine)

引入受PUCT启发重用机制,在缓冲区中维护历史尝试,优先扩展最具潜力(奖励最高)状态,兼顾探索。

设计旨在科学发现中特定问题超越已有知识(训练数据),而非在已知数据分布中寻找规律。

AI在测试中不断尝试,从失败经验中学习,找到特定问题数据分布。

核心逻辑:无现成训练数据,大模型如何学习?

TTT-Discover实现方式:模型生成动作并接收环境反馈,成千上万次尝试(含大量失败记录)存入缓冲区。由模型自身搜索产生的尝试构成特定问题“私有数据集”,解决分布外(OOD)问题无数据可练困境。

测试时训练:推动大模型科学发现的新前沿 测试时训练 强化学习 熵目标函数 PUCT重用策略 第3张

熵目标函数与PUCT重用策略

传统强化学习方法局限:

  • 目标函数优化平均性能,对刷新最优解不敏感。
  • 每次尝试从头开始,有效时界过短。
  • 重用已有解等价延长时界,发现类问题不对固定初始状态分布保持鲁棒。

研究引入熵目标函数(Entropic Objective)与PUCT启发的状态选择机制

测试时训练:推动大模型科学发现的新前沿 测试时训练 强化学习 熵目标函数 PUCT重用策略 第4张

熵目标函数引导训练偏好奖励最大动作而非平均奖励最高轨迹。研究还引入KL惩罚项对优势函数塑形,强化高优势动作同时维持必要探索能力。

论文核心作者介绍

测试时训练:推动大模型科学发现的新前沿 测试时训练 强化学习 熵目标函数 PUCT重用策略 第5张论文一作及共一为Mert YuksekgonulDaniel Koceja。Mert Yuksekgonul现于斯坦福大学计算机科学系攻读博士学位,导师为Carlos GuestrinJames Zou;Daniel Koceja现于Stanford Artificial Intelligence Laboratory(SAIL)担任全职研究员,接受Yu Sun指导。

测试时训练:推动大模型科学发现的新前沿 测试时训练 强化学习 熵目标函数 PUCT重用策略 第6张通讯作者为Yu Sun,斯坦福大学博士后兼英伟达研究员。博士毕业于UC Berkeley,师从Alexei EfrosMoritz Hardt.