当前位置:首页 > 科技资讯 > 正文

DeepSeek-V3与Mistral:技术争议与架构对比

“DeepSeek-V3的根基,植根于Mistral提出的架构。”

此言一出,欧洲版OpenAI CEO的言论掀起了轩然大波。

网友们的反应be like:

DeepSeek-V3与Mistral:技术争议与架构对比 DeepSeek-V3 Mistral 稀疏混合专家系统 技术争议 第1张

这是温和派的反应,还有更直接的吐槽:Mistral在胡说八道些什么……

DeepSeek-V3与Mistral:技术争议与架构对比 DeepSeek-V3 Mistral 稀疏混合专家系统 技术争议 第2张

还没吃上瓜的家人们别着急,咱们从头捋一捋这事儿:

在最近一次访谈中,当被问及如何看待中国开源AI的强势发展时,Mistral联合创始人、CEO Arthur Mensch这样回应:

中国在AI领域实力强劲。我们是最早发布开源模型的公司之一,而他们发现这是一个很好的策略。

开源不是真正的竞争,大家在彼此的基础上不断进步。

比如我们在2024年初发布了首个稀疏混合专家模型(MoE),DeepSeek-V3以及之后的版本都是在此基础上构建的。它们采用的是相同的架构,而我们把重建这种架构所需的一切都公开了。

DeepSeek-V3与Mistral:技术争议与架构对比 DeepSeek-V3 Mistral 稀疏混合专家系统 技术争议 第3张

Arthur Mensch很自信,但网友们听完表示:桥豆麻袋,这不对劲。

且不说DeepSeek MoE论文的发布时间和Arthur Mensch提到的Mixtral论文相差仅3天:

DeepSeek-V3与Mistral:技术争议与架构对比 DeepSeek-V3 Mistral 稀疏混合专家系统 技术争议 第4张

DeepSeek-V3与Mistral:技术争议与架构对比 DeepSeek-V3 Mistral 稀疏混合专家系统 技术争议 第5张

认真细扒起来,两种架构实际上思路也并不相同。

并且此前,Mistral 3 Large还曾被扒出基本上照搬了DeepSeek-V3采用的架构……

DeepSeek-V3与Mistral:技术争议与架构对比 DeepSeek-V3 Mistral 稀疏混合专家系统 技术争议 第6张

数学公式揭示区别

甭管怎么说,Mistral这发言一出来,严谨的网友们第一反应还是精准论证。

两篇论文都在arXiv上立等可看,那么就是一手直接开扒。

Arthur Mensch说的没错的一点是,这两篇发表时间相差3天的论文,研究的都是稀疏混合专家系统(SMoE),目的都是通过稀疏激活来降低计算成本并提升模型能力。

但两者在出发点上有所不同——

Mixtral偏向于工程思维,重点放在证明强大的基础模型+成熟的MoE技术,可以实现超越更大稠密模型的效果。

而DeepSeek的核心在于算法创新。论文试图解决传统MoE中专家“学得太杂”和“重复学习”的问题,本质上是对MoE架构的重新设计

DeepSeek-V3与Mistral:技术争议与架构对比 DeepSeek-V3 Mistral 稀疏混合专家系统 技术争议 第7张

数学公式可以更直观地反映区别。

Mixtral:

DeepSeek-V3与Mistral:技术争议与架构对比 DeepSeek-V3 Mistral 稀疏混合专家系统 技术争议 第8张

DeepSeek:

DeepSeek-V3与Mistral:技术争议与架构对比 DeepSeek-V3 Mistral 稀疏混合专家系统 技术争议 第9张

两者都采用了GShard风格的Top-K router。但DeepSeek改变了传统MoE架构中的门控机制和专家结构。

网友:开始岁月史书了?

...