在科技日新月异的今天,我们不断思考:如何运用AI找到科学问题的最优解?
一种常见的策略是“测试时搜索”(Test-time search),即让冻结(不更新参数)的大型语言模型(LLM)多次尝试,类似人类编程时的“猜测”方法。特别是进化搜索方法(如AlphaEvolve),将过去的尝试存入缓冲区,并通过人工设计、领域相关的启发式规则生成新的提示。
尽管这些提示能改进LLM的解法,但LLM本身并未真正提升,如同学生无法内化作业背后的新思想。
实际上,让LLM真正进步的最直接方式是学习。
尽管“学习”和“搜索”都能随着算力扩展而良好增长,但在AI发展史上,“学习”往往超越了“搜索”,特别是在围棋、蛋白质折叠等难题上。因为,科学发现本质是:超出训练数据与人类现有知识的out-of-distribution问题。
为此,斯坦福大学、英伟达等机构联合提出新方法:测试时进行强化学习(RL),即让LLM在解决特定测试问题的过程中持续训练自己。
具体来说,团队将单个测试问题定义为一个环境,并执行强化学习(RL)。任何标准RL技术原则上都可应用。但目标与传统RL存在关键差异:不是让模型在所有问题上平均表现更好,而是解决单一问题,并只产出一个优秀解决方案。
团队将此方法命名为“Test-Time Training to Discover”(TTT-Discover)。为了达成目标,其学习目标函数和搜索子程序都旨在优先考虑最有希望的解决方案。
结果显示,该方法在多种任务上取得佳绩,包括击败DeepMind的AlphaEvolve;在数学领域取得Erdős最小重叠问题新突破;在GPUMode竞赛中开发出比人类最佳内核快两倍的全新A100 GPU内核;在AtCoder测试中超越最佳AI代码和人类代码;在单细胞分析去噪任务中取得最佳成绩……
值得注意的是,该方法在计算成本上非常低,每个问题只需花费几百美元。
在业界看来,TTT-Discover的理念为持续学习打开了新的想象空间。
下图展示了TTT-Discover的核心机制,展示其在测试阶段针对单个问题持续对大语言模型(LLM)进行训练的过程。该图描绘了TTT-Discover在GPUMode TriMul竞赛中测试时,第0步、第9步、第24步以及第49步(最终阶段)的奖励分布情况,每一步都会生成512个候选解。
可见,随着训练推进,LLM逐渐生成更优的解,并最终超越以往最优结果(即人类最佳方案)。
需要注意的是,TTT-Discover没有直接套用标准RL算法(如PPO/GRPO)。
团队认为,标准RL优化的是期望奖励(平均分),而科学探索只关注最大奖励(最高分)。只要能找到一个突破性解,策略在其他时候表现差也没关系。这种策略容易让发现探索仅止步于“安全但平庸”的高分区域,而不敢尝试可能带来突破的高风险区域。另外,传统算法每次从头开始,无法逐步演化复杂解。
为此,团队引入两个关键组件解决上述问题。
一是熵目标函数,通过指数加权极端偏向高奖励样本。随着β→∞,熵目标函数趋近于最大值(max)。然而,团队发现,训练早期若β过大,会导致训练不稳定;训练后期若β过小,则随着改进幅度越来越微小,优势函数会逐渐消失。这说明为不同任务设定统一且固定的β常数非常困难。
为此,团队为每一个初始状态自适应地设置β(s),通过约束由该目标函数诱导的策略的KL散度实现。
二是受PUCT启发的状态复用策略,采用该规则选择初始状态。每个状态s的评分为:
其中,Q(s)表示当初始状态为s时所生成状态中的最大回报(如果s尚未被选择过,则取R(s))。不同于以往研究中采用“平均回报”的做法,团队在Q(s)中使用的是子状态的最大回报。这也是关注的核心是从某个状态出发所能达到的最佳结果,而不是平均结果。这种设计确保搜索集中在最有前景的解决路径上,同时保持多样性。
整体来看,熵目标和PUCT复用策略的结合使TTT-Discover能够优先发现单一的最高奖励解决方案,而不是多个解决方案的平均表现。
团队在数学、GPU内核工程、算法设计和生物学问题上评估了TTT-Discover。
除了考虑潜在影响力外,选择领域的标准还考虑两个方面:首先,选择能够将自身表现与人类专家比较的领域。例如,可以通过与人类工程竞赛中的最佳提交方案或学术论文中报告的最佳结果对比实现。数学和算法设计是近期相关工作取得非常大进展的领域之一。
在每个应用中,团队都报告了已知的人类最佳结果和AI最佳结果。
在数学领域,关于构造数学对象(如阶跃函数)来证明不等式更紧致边界的Erdős最小重叠问题任务上,之前人类最佳表现是0.380927、AI最佳表现(AlphaEvolve)是0.380924。而TTT-Discover刷新记录,拿到了0.380876的成绩。
在GPU内核优化任务中,需要说明的是“新的最优解”(state of the art)意味着实现了比现有方案更快的内核实现。团队选择GPUMODE作为评测平台,因其排行榜经过大量人类竞赛的充分验证并配备了稳健的评测框架。同时其基准测试避免了信噪比问题。
结果是团队的TriMul内核在所有GPU类型上均达到当前最优水平。在A100上TTT-Discover找到的最佳内核比人类专家提交的最优方案快50%。尽管在训练阶段团队的奖励函数未在A100上直接计时。总体而言在所有GPU类型上该方法都相对于人类最佳结果实现超过15%的性能提升。
而在另外两项测试中TTT-Discover同样取得非凡成绩。
本文由主机测评网于2026-06-16发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647776.html