当前位置:首页 > 科技资讯 > 正文

DeepSeek与字节Seed:大模型架构创新的接力赛

2026年1月已过大半,我们依然未见DeepSeek V4的身影,但其轮廓已逐渐清晰。

近期,DeepSeek连续发布两篇论文,一篇聚焦于信息如何稳定流动,另一篇则致力于知识的高效检索。

当第一篇论文(mHC)发布时,读者普遍表示困惑,纷纷求助于AI助手以多种方式进行解读。我们浏览了网友的讨论,发现深入理解的关键在于追溯研究脉络,看看这些年来研究者们是如何接力推进的。理解第二篇论文(Conditional Memory)亦是如此。

于是,我们回顾了各路研究者的分析。此时,我们发现一个有趣的现象:DeepSeek与字节Seed团队的工作存在“接力”关系——mHC在字节Seed团队HC(Hyper-Connections)的基础上进行了重大改进;而Conditional Memory则引用了字节Seed的OverEncoding、UltraMem等多项工作。

理清这些工作之间的关系,不仅能帮助我们更好地理解DeepSeek的论文,还能洞察大模型架构创新的突破方向。

残差连接的十年接力

要理解mHC,需追溯至2015年。

那年,AI领域的领军人物何恺明等人提出了ResNet,通过残差连接解决了深度神经网络训练中的难题:网络层数增多时,信息前向传递会逐渐失真,后几层难以学习。残差连接的设计很简单,每一层不仅接收上一层的输出,还保留原始输入,两者相加后继续传递。

这一设计成为深度学习的基石,十年来几乎所有主流深度网络架构都默认配置了残差连接。从视觉领域的各种CNN,到自然语言处理领域的Transformer,再到如今的大语言模型,无一例外。

期间,研究者们在注意力机制、归一化方法、激活函数等方面进行了大量改进,但残差连接的基本形式几乎没有根本性变化。

直到2024年9月,字节Seed提出了HC,论文后来被ICLR 2025接收。

HC的核心创新在于显著提升了网络的拓扑复杂度,同时不增加单个计算单元的FLOPs开销。这意味着在相同的计算预算下,模型可以探索更丰富的特征组合方式。

中国人民大学长聘副教授、博士生导师刘勇认为:HC打破了由ResNet统治的恒等映射残差连接传统,提出了多路并发连接的新范式。它通过引入宽度动态性和跨层特征聚合,证明了通过增加残差路径的特征维和引入可学习的Dynamic Hyper Connections可以有效缓解Representation Collapse的问题,并提升大语言模型的预训练效率,提供了一个超越传统残差网络的全新架构底座。

DeepSeek在mHC论文中表示:近年来,以Hyper-Connections(HC)为代表的研究为残差连接引入了一个新的维度,并在实验上验证了其显著的性能潜力。HC的单层结构如图1 (b)所示。通过扩展残差流的宽度并提升连接结构的复杂性,HC在不改变单个计算单元FLOPs开销的前提下,显著提升了网络的拓扑复杂度。

DeepSeek与字节Seed:大模型架构创新的接力赛 DeepSeek 字节Seed mHC Conditional Memory 第1张

可以看出:字节Seed提出的“扩展残差流宽度+可学习连接矩阵”这一新架构范式构成了其后续方法设计的重要基础。

然而,HC在走向大规模训练的过程中遇到了瓶颈,导致训练不稳定和可扩展性受限。尽管如此,但其为后续研究指明了方向。刘勇认为,HC论文为mHC研究提供了三个核心思路:

首先是宽度扩展(Stream Expansion),即通过扩大残差流维度(如扩大至4倍或更多),能显著增强模型的容量和学习能力;

其次是多尺度连接的权重化,通过引入可学习矩阵来分配不同层级特征的贡献,启示了连接权重管理(mHC中的Sinkhorn-Knopp算法)的重要性;

最后是动态拓扑的潜力,论文展示了模型可以根据深度动态调整特征流向,这种软拓扑结构为解决深层网络训练难点提供了新视角。这些探索让mHC意识到,虽然拓扑结构的复杂化能带来增益,但也必须解决随之而来的训练稳定性与工程效率问题。

正是基于这些探索,DeepSeek团队明确了mHC的研究方向:在继承HC架构优势的同时,针对性地解决其规模化瓶颈。

刘勇指出:mHC针对HC在大规模部署时暴露的稳定性风险和内存访问开销进行了针对性改进。在研究思路上,mHC延续了HC的宽度扩展与多路径聚合,并进一步通过Sinkhorn-Knopp等技术手段施加流形约束,将HC的广义空间投影回特定流形,从而在保留HC性能优势的同时恢复了残差网络至关重要的恒等映射特性;在工程层面提出了更高效的内核优化(Infrastructure Optimization),使该范式从理论实验走向了万亿级参数规模的工业级应用。

基于这些改进mHC不仅解决了稳定性问题在大规模训练中(如27B模型)表现出卓越的可扩展性。

我们不难发现mHC解决了HC在大规模训练中的工程瓶颈。通过引入流形约束mHC在保留HC架构优势的同时恢复了训练稳定性使得这一新范式真正具备了在主流大模型训练中应用的条件。

有网友认为:DeepSeek提出的mHC是对字节Seed HC训练架构技巧的一次有力推进。

DeepSeek与字节Seed:大模型架构创新的接力赛 DeepSeek 字节Seed mHC Conditional Memory 第2张

从2015年残差连接问世到2024年字节Seed提出HC再到2026年DeepSeek提出mHC我们清晰地看到残差连接在算法上的演进是不同机构、研究者持续接力和优化的结果。

而在DeepSeek发布的另一篇论文中我们看到了几乎相同的模式再次上演。

都用N-gram字节Seed、DeepSeek接连导出新结论

“Conditional Memory”论文与mHC论文的“抽象”感不同它解决的问题较为直观:大模型被问到很多问题可以直接查表解决如“法国的首都是哪里”但由于标准Transformer缺乏原生的知识查找原语即使这样简单的问题模型也得去计算这无疑是种浪费。

“Conditional Memory”的解决方案是给模型装一个“小抄本”(Engram)常见的词组直接查表省下的算力用来做更复杂的推理。

具体来说Engram的做法是:给模型配一个巨大的“词组词典”当模型读到某个词(比如“Great”时把它前面几个词拼成N-gram(比如“the Great”或“Alexander the Great”)然后用哈希函数把这个N-gram变成一个数字直接去词典里查对应的向量。

“N-gram哈希查表”的做法字节Seed之前也用过。在提出OverEncoding方法(题为“Over-Tokenized Transformer: Vocabulary is Generally Worth Scaling”)的论文中他们发现:给模型配一个巨大的N-gram词典几乎是“白捡”的性能提升。为什么说是白捡?刘勇分析说因为这些海量的嵌入参数是稀疏激活的每次推理只查其中极少数所以不怎么吃显存也不怎么费算力。更重要的是论文发现词典越大性能越好而且提升幅度是可预测的。

研究发表的意义具象化了

一起上分、互相启发