当前位置:首页 > 科技资讯 > 正文

重塑记忆:从学习视角探索AI的上下文处理

近年来,谷歌的Nested Learning为模型界带来了一场记忆革命,让人们重新认识到大模型可以在推理过程中持续变化,而非仅仅是「训练完就封存」的只读权重。

在Nested Learning中,模型在读取新上下文时,不仅能够临时翻找文本,还能在推理过程中更改参数,使新信息成为其内部记忆的一部分。然而,就在人们还在消化这一想法时,英伟达在2025年12月28日提出了更激进的观点,即记忆就是学习,「记住」就是「继续训练」。

重塑记忆:从学习视角探索AI的上下文处理 Nested Learning TTT-E2E 上下文处理 元学习 第1张

英伟达和斯坦福的研究者相信,AI也应该像人一样,通过感受塑造价值观,而非仅仅记住字句。他们提出了End-to-End Test-Time Training(TTT-E2E)方法,用学习替代注意力式的记忆。

01 用学习,替代注意力式的记忆

早在2013年,Mikolov等人就在语言模型中尝试过dynamic evaluation,通过解除冻结在测试文本上继续用交叉熵损失(CE)进行小步梯度更新。而TTT-E2E则是直接放弃通过「内化」(权重更新)知识来解决上下文处理的问题。

重塑记忆:从学习视角探索AI的上下文处理 Nested Learning TTT-E2E 上下文处理 元学习 第2张

Transformer的辉煌建立在很大程度上在注意力机制上,但这种方法非常耗费内存。而TTT的方案则是通过测试时更新权重,解决上下文处理的问题,无论上下文多长,其推理状态大小和计算量都是永远不变的。

因此,在TTT家族中,不论上下文如何增长,其Latency(生成延迟)都不会有任何变化。

重塑记忆:从学习视角探索AI的上下文处理 Nested Learning TTT-E2E 上下文处理 元学习 第3张

这是TTT带来的核心能力:无延迟地记住近乎无限的上下文。尽管dynamic evaluation一直没有成为主流部署范式,但TTT-E2E的出现让这一可能性变得更加明确。