针对大模型记忆能力的提升,全球科技巨头英伟达携手Astera研究所、斯坦福大学等知名学府,共同推出了革命性的TTT-E2E方法。
在128K的超长文本处理上,该方法相较于全注意力模型速度提升2.7倍,面对2M的上下文时更是达到了惊人的35倍提速,性能依旧卓越。
与近期热门的DeepSeek条件记忆模块不同,TTT-E2E采用了一种更为动态的学习方式,其核心在于上下文压缩。
通过实时学习将关键内容压缩到模型权重中,确保在测试阶段依然保持学习状态,既避免了额外缓存的负担,又能精准捕捉长文本中的核心逻辑。
TTT-E2E并没有采用复杂的特殊架构,而是基于标准的Transformer带滑动窗口注意力,这使得其部署变得异常简单。
该方法的核心理念是将长文本建模从架构设计问题转化为“持续学习”任务。在测试阶段,模型会基于当前读取的上下文进行下一个词预测。
每读取一段文本,就通过梯度下降更新自身参数,通过这种方式持续训练自身,把读到的文本信息动态压缩到权重中,无需额外存储冗余数据。
为了平衡效率与稳定性,TTT-E2E还设计了三项关键优化。采用“迷你批处理+滑动窗口”的组合策略;精准更新策略,只更新模型的MLP层且只更新最后1/4的网络块;双MLP设计,一个用于存储预训练知识,另一个用于吸收新上下文。
从实验数据来看,TTT-E2E的表现非常亮眼。在3B参数模型的测试中,其在128K上下文长度下的测试损失与全注意力Transformer持平甚至更优。
此外,经Qwen-8B模型评估,TTT-E2E在解码长序列任务中生成的文本质量稳定,损失值持续低于传统模型。
尽管TTT-E2E在大海捞针这类需要精准回忆细节的任务中表现稍逊于全注意力模型,但其在推理延迟上的表现却十分稳定。实验结果显示,该方法的推理延迟与上下文长度无关,始终保持恒定。
目前,TTT-E2E的代码和相关论文已完全开源。该项目由斯坦福的博士后研究员Yu Sun领导,他同时也是该研究的核心贡献者。
他研究的总体目标是让人工智能系统能够像人类一样持续学习。自2019年以来,他就在开发“测试时训练”的概念框架,而TTT-E2E项目的早期构想正是他提出的。
论文地址:https://arxiv.org/abs/2512.23675
本文由主机测评网于2026-06-11发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260646901.html