摘要:
早在2025年11月,DeepSeek就因团队扩张而开放行政招聘,以迎接更多合作伙伴的加入。
尽管距离春节尚早,科技圈已步入假期模式,但DeepSeek却选择在这个时间点上不断突破自我。
近日,DeepSeek在GitHub上开源了新模块Engram的代码,并发布了《Conditional Memory via Scalable Lookup》论文。更早之前,元旦当天还发布了《mHC》论文,探讨模型架构的稳定性。
这些论文的作者名单中,都出现了DeepSeek创始人梁文锋的名字。这种高密度的技术输出,无疑在向外界传递一个明确信号:在沉默的这段时间里,DeepSeek并没有休息,他们在为下一代模型积攒弹药。
旺盛的招聘需求似乎印证了这一点。凤凰网科技发现,DeepSeek近期正在大量招人,涵盖了深度学习研究员、深度学习研发工程师、大模型全栈工程师等核心岗位。且校招、社招、实习均开放,另有产品、设计、数据等岗位开放。
值得一提的是,根据此前梁文锋署名的论文作者名单,整个DeepSeek的人员稳定性极高,此次招聘主要是扩招需求。此外,大部分岗位都可以在北京或杭州工作。
就在全行业都在盘点2025年应用层得失的时候,DeepSeek把目光锁在了架构层。
最新发布的Engram研究是与北京大学合作完成的。这项研究直指当前Transformer架构的一个痛点:大模型虽然通过MoE实现了“条件计算”,但缺乏原生的“条件记忆”。现在的模型记东西太笨,只能靠计算来模拟检索。DeepSeek提出的Engram模块,要给大模型装上一个外挂式的“硬盘”,让它能像查字典一样,以O(1)的时间复杂度调取知识。
元旦发布的《mHC:流形约束超连接》中,梁文锋和他的团队解决了另一个问题——超大规模模型的训练稳定性。随着模型越来越大,传统的残差连接开始失效,训练容易崩溃。DeepSeek用一套数学方法,把神经网络的连接方式约束在特定的流形空间里,恢复了信息传递的稳定性。
现在高潮或许快来了,所有的线索都指向了同一个方向:DeepSeek V4。
如果我们把这两篇论文叠加在一起看,V4的轮廓已经呼之欲出。它不会是一个单纯堆砌参数的庞然大物,而是一个架构精巧的“缝合怪”:它将拥有MoE带来的极致计算效率,同时集成了Engram带来的海量低成本记忆,底层则由mHC架构支撑其在超大规模下的训练稳定性。
Engram的论文中提到了一个细节:这种架构支持“预取-重叠”策略,可以利用CPU内存来存知识。这意味着V4极有可能在保持推理成本低廉的同时,拥有远超当前一代模型的知识容量和长上下文处理能力。
此外,mHC的成功验证意味着DeepSeek已经掌握了训练更大规模多模态模型的“稳定器”。对于算力资源本就不富裕的国内AI圈,这种算法层面的效率提升具有战略意义。
本文由主机测评网于2026-06-11发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260646929.html