如果把现在的AI模型比作学霸,它们通常在学校(预训练阶段)博览群书,将知识内化为己有(参数冻结)。等到考试(推理阶段),它们凭借「回忆」和「逻辑推演」来答题。
即便是像OpenAI的o1这种「会思考」的模型,也只是在考场上多打草稿(CoT思维链),其大脑回路(权重)依然固定不变。
但本周,一篇名为《Learning to Discover at Test Time》的论文横空出世,来自斯坦福大学和英伟达的研究团队提出了一种不仅打草稿,更敢在考场「现场长脑子」的新范式——TTT-Discover(Test-Time Training,测试时训练)。
这是对「智能」定义的又一次挑战。
这项研究的核心逻辑非常反直觉:它不追求「平均分」,只想要那一次「满分」。
在传统强化学习中,我们期望训练出全能选手,不仅要做对这道题,未来遇到类似题也能应对自如。
但TTT-Discover说:不,科学发现(Discovery)不需要「通用」。
例如,寻找治愈癌症的新分子或数学猜想的反例。
只要找到这一个答案,哪怕模型在这个过程中严重偏科,甚至为了这道题而自我毁灭(过拟合),忽略了其他所有题,又有什么关系呢?
只要那个答案是对的,人类就赢了。
基于这个理念,TTT-Discover采用了一种极其激进的策略:
现场进化:在推理阶段,针对当前特定问题,利用强化学习直接修改模型参数。
赌徒心态:它修改了损失函数,不再追求稳健,而是鼓励模型探索极端、高风险高回报区域。
用完即弃:这个针对特定问题进化出的「特种兵」模型,解完题即可丢弃。
「不看广告看疗效」。
这篇论文最硬核的地方在于它挑选的对手全是硬骨头。
1. 数学界的「毫厘之争」
在著名的Erdős最小重叠问题(困扰数学家数十年的数论难题)上,人类和此前最强AI(AlphaEvolve)的竞争已经卷到小数点后几位。TTT-Discover进场后,直接把上界从0.380924压低到0.380876。
别小看这小数点后四位的变化,在理论数学的无人区,每推进一步都在重写历史。
它构造出一个极其复杂、拥有600个分段的非对称函数,而之前的人类最佳构造仅有51段。
虽然战绩辉煌,但作为一篇严谨科普,必须指出其「阿喀琉斯之踵」。
第一,它真的「贵」。
传统AI回答一个问题可能只需几分钱的算力。
而TTT-Discover为了解决问题,需要在测试时进行几千次甚至上万次的采样和训练。
论文坦承,解决单道题的成本约为500美元(约合人民币3500元)。
本文通讯作者Yu Sun是Test-Time Training (TTT)概念的坚定布道者和总设计师,目前是斯坦福大学博士后及英伟达研究员。
很多研究者会追逐不同热点(如Diffusion、RAG),但Yu Sun极其罕见地死磕一个概念长达7年。
1.0时代(视觉修复):
2.0时代(架构革命):
本文由主机测评网于2026-06-15发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647602.html