这已经是2025年以来的第4次,DeepSeek创始人梁文锋和月之暗面创始人杨植麟在技术创新上精准“撞车”。
1月27日,月之暗面发布并开源新模型Kimi K2.5,该模型由K2和K2-Thinking并存演进而来。在官方视频里,杨植麟将其形容为“全能模型”,不仅封装了视觉理解、代码、多模态能力,还具备了思考与非思考模式、Agent及Agent集群能力。
K2.5的一大亮点在于“视觉理解能力”的极大增强,可分析用户上传的图片、视频,并据此编程或解答问题。与此同时,DeepSeek也于同日上线了新一代模型OCR-2,在视觉理解上取得重大突破,通过创新“视觉因果流”机制,实现动态调整阅读顺序。
梁文锋与杨植麟在视觉理解领域的数次同日发布成果,很难用偶然来解释。他们二人又为何不约而同地瞄准了视觉理解这座山峰?
实际上,梁文锋和杨植麟虽然成果发布时间相近,但他们在关键技术路线上“和而不同”的创新,背后是对大模型和产业痛点的相似判断。
例如,2025年1月20日,DeepSeek-R1上线后火速破圈。Kimi 1.5也紧随其后发布,且同样采用了“基于结果奖励的强化学习”路线。同年2月18日,两人又分别提出了针对Transformer注意力机制下效率问题的新架构。
其中,梁文锋提出了DeepSeek-NSA(原生稀疏注意力)架构,大幅降低了长上下文处理的算力消耗;而杨植麟则提出了MoBA(混合块注意力)架构,通过分块处理与动态门控机制,让模型自主实现全注意力与稀疏注意力的切换。
这些创新虽路径不同,但核心目标一致:解决效率瓶颈,让模型在复杂任务中更具实用性。而最近的一次同台竞技,则再次聚焦于视觉理解领域。
实际上,在大语言模型层面,国内模型正在与海外模型日益拉近距离。但在视觉理解层面,海外模型已领先一步。
此次发布中,杨植麟展示了K2.5通过识别图片或视频复刻网址的功能。而国内大模型则更多需要借助语言、指令来实现。
“一图胜千言。”科技博主海拉鲁表示,视觉理解的核心意义在于让大模型从“读文字”升级为“懂信息、用信息。”
K2.5是月暗在视觉理解上交出的第一份答卷。团队让原生的多模态架构设计与大规模视觉文本进行联合预训练,构建Visual Agentic Intelligence系统。而DeepSeek则通过引入全新的视觉编码器DeepEncoder V2,模仿人类视觉的“因果流”逻辑。
除了视觉理解,此次K2.5的Agent集群功能也获得了不少业内人士的称道。
K2.5引入的Agent Swarm架构,从单一Agent进化到Agent集群,提升了任务执行效率。在杨植麟的介绍中,K2.5不再是一个单打独斗的智能体,而是一支即时组建的“智能体团队”。
据《中国企业家》了解,K2.5整个Agent集群由K2.5模型全自动创建与协调,用户无需对子智能体或工作流进行预先定义。这意味着未来的智能体将无需人工设计工作流,真正实现人力的解放。
本文由主机测评网于2026-06-16发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647854.html