当前位置:首页 > 科技资讯 > 正文

DeepSeek-OCR2:视觉因果流重塑OCR新纪元

【探索前沿】DeepSeek发布DeepSeek-OCR2,引领创新,采用全新DeepEncoder V2视觉编码器,突破传统模型局限,模拟人类视觉的「因果流」逻辑。

DeepSeek再次革新!

此番是DeepSeek-OCR模型的重大升级:DeepSeek-OCR2

DeepSeek-OCR2:视觉因果流重塑OCR新纪元 DeepSeek-OCR2 DeepEncoder V2 因果推理 多模态统一 第1张

还记得之前的DeepSeek-OCR吗?那个以视觉方式压缩万物的模型。

这次,DeepSeek更进一步,对视觉编码器进行了革新,推出了全新的DeepEncoder V2架构,实现了从「固定扫描」到「语义推理」的范式转变!

DeepSeek-OCR2:视觉因果流重塑OCR新纪元 DeepSeek-OCR2 DeepEncoder V2 因果推理 多模态统一 第2张

DeepSeek-OCR2不仅能像人类一样按逻辑顺序阅读复杂文档,还在多项基准测试中刷新了SOTA。

当然,按照DeepSeek的惯例,Paper、Code、Model全开源!

DeepSeek-OCR2:视觉因果流重塑OCR新纪元 DeepSeek-OCR2 DeepEncoder V2 因果推理 多模态统一 第3张

项目地址:https://github.com/deepseek-ai/DeepSeek-OCR-2

模型下载:https://huggingface.co/deepseek-ai/DeepSeek-OCR-2

论文地址:https://github.com/deepseek-ai/DeepSeek-OCR-2/blob/main/DeepSeek_OCR2_paper.pdf

DeepSeek-OCR2的核心创新在于通过DeepEncoder V2,赋予了模型因果推理能力(Causal Reasoning)。

这就像是给机器装上了「人类的阅读逻辑」,让AI不再只是死板地从左上到右下扫描图像,而是能根据内容语义灵活调整阅读顺序。

DeepSeek-OCR2:视觉因果流

DeepSeek在论文中指出,传统的视觉语言模型(VLM)通常采用光栅扫描(Raster-Scan)顺序处理图像,即固定地从左到右、从上到下。

这种方式强行将2D图像拍扁成1D序列,忽略了图像内部的语义结构。

DeepSeek-OCR2:视觉因果流重塑OCR新纪元 DeepSeek-OCR2 DeepEncoder V2 因果推理 多模态统一 第4张

这显然与人类的视觉习惯背道而驰。

人类在看图或阅读文档时,目光是随着逻辑流动的:先看标题,再看正文,遇到表格会按列或按行扫视,遇到分栏会自动跳跃。

为了解决这个问题,DeepSeek-OCR2引入了DeepEncoder V2。

它最大的特点是用一个轻量级的大语言模型(Qwen2-0.5B)替换了原本的CLIP编码器,并设计了一种独特的「因果流查询」(Causal Flow Query)机制。

DeepEncoder V2架构详解

DeepEncoder V2主要由两部分组成:

1. 视觉分词器(Vision Tokenizer)

沿用了SAM-base(80M参数)加卷积层的设计,将图像转换为视觉Token。

DeepSeek-OCR2:视觉因果流重塑OCR新纪元 DeepSeek-OCR2 DeepEncoder V2 因果推理 多模态统一 第5张

2. 作为视觉编码器的LLM

这里DeepSeek使用了一个Qwen2-0.5B模型。

它不仅处理视觉Token,还引入了一组可学习的「查询Token」(Query Tokens)。

DeepSeek-OCR2:视觉因果流重塑OCR新纪元 DeepSeek-OCR2 DeepEncoder V2 因果推理 多模态统一 第6张

关键的创新点在于注意力掩码(Attention Mask)的设计:

DeepSeek-OCR2:视觉因果流重塑OCR新纪元 DeepSeek-OCR2 DeepEncoder V2 因果推理 多模态统一 第7张

视觉Token之间采用双向注意力(Bidirectional Attention),保持全局感知能力,类似于ViT。

而查询Token则采用因果注意力(Causal Attention),每一个查询Token只能看到它之前的Token。

通过这种设计,DeepEncoder V2实现了两级级联的因果推理:

编码器通过可学习的查询对视觉Token进行语义重排,随后的LLM解码器则在这个有序序列上进行自回归推理。

性能卓越:更少Token,更高精度

实验数据显示,DeepSeek-OCR2在保持极高压缩率的同时,性能显著提升。

在OmniDocBench v1.5基准测试中,DeepSeek-OCR2在使用最少视觉Token(仅256-1120个)的情况下,综合得分高达91.09%,相比前代提升了3.73%。

DeepSeek-OCR2:视觉因果流重塑OCR新纪元 DeepSeek-OCR2 DeepEncoder V2 因果推理 多模态统一 第8张