当前位置:首页 > 科技资讯 > 正文

AI考场进化:测试时训练,挑战智能新极限

如果把现在的AI模型比作学霸,它们通常在学校(预训练阶段)博览群书,将知识内化为己有(参数冻结)。等到考试(推理阶段),它们凭借「回忆」和「逻辑推演」来答题。

即便是像OpenAI的o1这种「会思考」的模型,也只是在考场上多打草稿(CoT思维链),其大脑回路(权重)依然固定不变。

但本周,一篇名为《Learning to Discover at Test Time》的论文横空出世,来自斯坦福大学和英伟达的研究团队提出了一种不仅打草稿,更敢在考场「现场长脑子」的新范式——TTT-Discover(Test-Time Training,测试时训练)。

AI考场进化:测试时训练,挑战智能新极限 Test-Time Training 智能进化 单次满分 动态过程 第1张

这是对「智能」定义的又一次挑战。

核心颠覆

这项研究的核心逻辑非常反直觉:它不追求「平均分」,只想要那一次「满分」。

在传统强化学习中,我们期望训练出全能选手,不仅要做对这道题,未来遇到类似题也能应对自如。

但TTT-Discover说:不,科学发现(Discovery)不需要「通用」。

例如,寻找治愈癌症的新分子或数学猜想的反例。

只要找到这一个答案,哪怕模型在这个过程中严重偏科,甚至为了这道题而自我毁灭(过拟合),忽略了其他所有题,又有什么关系呢?

只要那个答案是对的,人类就赢了。

基于这个理念,TTT-Discover采用了一种极其激进的策略:

现场进化:在推理阶段,针对当前特定问题,利用强化学习直接修改模型参数。

赌徒心态:它修改了损失函数,不再追求稳健,而是鼓励模型探索极端、高风险高回报区域。

用完即弃:这个针对特定问题进化出的「特种兵」模型,解完题即可丢弃。

AI考场进化:测试时训练,挑战智能新极限 Test-Time Training 智能进化 单次满分 动态过程 第2张

战绩:它真的比人类聪明吗?

「不看广告看疗效」。

这篇论文最硬核的地方在于它挑选的对手全是硬骨头。

AI考场进化:测试时训练,挑战智能新极限 Test-Time Training 智能进化 单次满分 动态过程 第3张

1. 数学界的「毫厘之争」

在著名的Erdős最小重叠问题(困扰数学家数十年的数论难题)上,人类和此前最强AI(AlphaEvolve)的竞争已经卷到小数点后几位。TTT-Discover进场后,直接把上界从0.380924压低到0.380876

别小看这小数点后四位的变化,在理论数学的无人区,每推进一步都在重写历史。

AI考场进化:测试时训练,挑战智能新极限 Test-Time Training 智能进化 单次满分 动态过程 第4张

它构造出一个极其复杂、拥有600个分段的非对称函数,而之前的人类最佳构造仅有51段。

冷静一下,它不是万能神药

虽然战绩辉煌,但作为一篇严谨科普,必须指出其「阿喀琉斯之踵」。

第一,它真的「贵」。

传统AI回答一个问题可能只需几分钱的算力。

而TTT-Discover为了解决问题,需要在测试时进行几千次甚至上万次的采样和训练。

论文坦承,解决单道题的成本约为500美元(约合人民币3500元)。

作者简介

本文通讯作者Yu Sun是Test-Time Training (TTT)概念的坚定布道者和总设计师,目前是斯坦福大学博士后及英伟达研究员。

他的核心思想

很多研究者会追逐不同热点(如Diffusion、RAG),但Yu Sun极其罕见地死磕一个概念长达7年。

TTT三部曲:从修补到颠覆

1.0时代(视觉修复):

AI考场进化:测试时训练,挑战智能新极限 Test-Time Training 智能进化 单次满分 动态过程 第5张

2.0时代(架构革命):

AI考场进化:测试时训练,挑战智能新极限 Test-Time Training 智能进化 单次满分 动态过程 第6张