大模型持续学习又迎新突破!
斯坦福、英伟达等研究机构携手带来全新解决方案——Test-Time Training to Discover (TTT-Discover)。
基于开源模型gpt-oss-120b,TTT-Discover在多个领域达成SOTA,超越人类专家及闭源前沿模型。
不同于传统“测试时缩放”仅通过Prompt调度冻结模型的方法,TTT-Discover在测试阶段针对单个具体问题,引入强化学习(RL)更新模型权重。
此“测试时训练”使模型能从失败尝试中实时获取经验,更新参数,实现定向进化。
数学领域提出Erdős最小重叠问题新界及自相关不等式;Kernel工程方面,较顶级人类工程师快2倍;算法方面,历届AtCoder比赛题目上取得最高分;生物领域,单细胞RNA-seq去噪任务上达SOTA。
论文核心在于测试时强化学习 (Reinforcement Learning at Test Time),体现在:
1. 学习目标(Learning Objective)
区别于传统强化学习提升所有任务“平均奖励”以实现泛化,TTT-Discover采用熵目标函数(Entropic Objective)。通过调整权重倾向于奖励最高动作而非整条轨迹,核心目标是产生极优解而非多个平庸解。
2. 搜索程序(Search Subroutine)
引入受PUCT启发重用机制,在缓冲区中维护历史尝试,优先扩展最具潜力(奖励最高)状态,兼顾探索。
设计旨在科学发现中特定问题超越已有知识(训练数据),而非在已知数据分布中寻找规律。
AI在测试中不断尝试,从失败经验中学习,找到特定问题数据分布。
核心逻辑:无现成训练数据,大模型如何学习?
TTT-Discover实现方式:模型生成动作并接收环境反馈,成千上万次尝试(含大量失败记录)存入缓冲区。由模型自身搜索产生的尝试构成特定问题“私有数据集”,解决分布外(OOD)问题无数据可练困境。
传统强化学习方法局限:
研究引入熵目标函数(Entropic Objective)与PUCT启发的状态选择机制。
熵目标函数引导训练偏好奖励最大动作而非平均奖励最高轨迹。研究还引入KL惩罚项对优势函数塑形,强化高优势动作同时维持必要探索能力。
论文一作及共一为Mert Yuksekgonul与Daniel Koceja。Mert Yuksekgonul现于斯坦福大学计算机科学系攻读博士学位,导师为Carlos Guestrin与James Zou;Daniel Koceja现于Stanford Artificial Intelligence Laboratory(SAIL)担任全职研究员,接受Yu Sun指导。
通讯作者为Yu Sun,斯坦福大学博士后兼英伟达研究员。博士毕业于UC Berkeley,师从Alexei Efros与Moritz Hardt.
本文由主机测评网于2026-06-16发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647707.html