近年来,谷歌的Nested Learning为模型界带来了一场记忆革命,让人们重新认识到大模型可以在推理过程中持续变化,而非仅仅是「训练完就封存」的只读权重。
在Nested Learning中,模型在读取新上下文时,不仅能够临时翻找文本,还能在推理过程中更改参数,使新信息成为其内部记忆的一部分。然而,就在人们还在消化这一想法时,英伟达在2025年12月28日提出了更激进的观点,即记忆就是学习,「记住」就是「继续训练」。
英伟达和斯坦福的研究者相信,AI也应该像人一样,通过感受塑造价值观,而非仅仅记住字句。他们提出了End-to-End Test-Time Training(TTT-E2E)方法,用学习替代注意力式的记忆。
早在2013年,Mikolov等人就在语言模型中尝试过dynamic evaluation,通过解除冻结在测试文本上继续用交叉熵损失(CE)进行小步梯度更新。而TTT-E2E则是直接放弃通过「内化」(权重更新)知识来解决上下文处理的问题。
Transformer的辉煌建立在很大程度上在注意力机制上,但这种方法非常耗费内存。而TTT的方案则是通过测试时更新权重,解决上下文处理的问题,无论上下文多长,其推理状态大小和计算量都是永远不变的。
因此,在TTT家族中,不论上下文如何增长,其Latency(生成延迟)都不会有任何变化。
这是TTT带来的核心能力:无延迟地记住近乎无限的上下文。尽管dynamic evaluation一直没有成为主流部署范式,但TTT-E2E的出现让这一可能性变得更加明确。
本文由主机测评网于2026-06-13发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647236.html