提到DeepSeek,人们通常不会联想到多模态。然而,在10月20日,DeepSeek突然开源了DeepSeek-OCR。乍一看,它是一款OCR(光学字符识别)模型,并在OmniDocBench等权威基准上取得了SOTA(业界顶尖)的成绩。
为何它突然涉足OCR领域?答案在于当前大语言模型面临的最大挑战:长上下文处理的算力瓶颈。
论文的核心论点是:文本信息可以通过光学2D映射(即渲染成图像)被高效压缩,然后让VLM(视觉语言模型)从图像中解压出原始信息。
简单来说,就是将文本内容转换为图像形式,用比等效数字文本少得多的视觉token来表示相同的信息。
对此,Andrej Karpathy也表示深受启发,认为像素可能比文本更适合作为LLM的输入。
他列举了四大好处:
信息压缩:这将带来“更短的上下文窗口和更高的效率”。
更通用的信息流:输入不再局限于纯文本,还可以包含“粗体、彩色文本、任意图像”。
更强的处理方式:图像可以被“双向注意力”轻松处理,这比文本常用的自回归注意力“强大得多”。
删除Tokenizer:他强烈抨击了现有的分词器这个老大难问题。
本文将深度解析这一构想,探讨DeepSeek为何要用视觉这把锤子来敲文本这颗钉子。这一论文,可能会用一图胜千言的模式,改变以后LLM的整个输入范式。
在LLM的世界里,一切竞争的尽头似乎都是对“更长上下文”的追求。从几千token到几万,再到今天的百万、千万token窗口,这场军备竞赛从未停歇。
其背后的根本制约源于Transformer架构的灵魂——注意力机制。
标准的全局注意力允许序列中的每一个token都看到所有其它token,这赋予了模型强大的上下文理解能力。但在当前主流的自回归模型中,这种能力的代价是高昂的:因为每个token都要和前面所有token建立起乘积关系去预测下一个token,因此其计算复杂度和内存占用随序列长度成二次方增长。
尽管业界已经提出了分组注意力、多查询注意力、RoPE位置编码等优化技术来减少查询头的数量,但这些方法本质上都是试图优化中的那个token计算的平方复杂性,却从未真正减少token数量本身。
DeepSeek-AI团队的工程师们显然注意到了这个房间里的大象。他们跳出了优化注意力计算的内卷,提出了一个更根本的问题:我们能不能把token数量本身给“压缩”掉?
这就是光学压缩(Contexts Optical Compression)的逻辑起点。
要理解这个,我们得先弄明白视觉token和文本token的不同。视觉token是视觉模型处理图像时所使用的基本信息单元。文本模型(LLM)阅读的是文本token(单词或子词),而视觉模型(VLM)观看的就是视觉token。
在DeepSeek-OCR论文中,视觉token是先将高分辨率图像切割成小的图像块,在编码过程中,每个小图像块本身都会被转换成一个数字向量(即一个token),而这个向量就代表了该图像块的全部信息。因此一张1024*1024的图像就可以被划归成4096个视觉token。
而大小为其一半的图像能容纳的文字量大概是10000个文本token。
因此,一张包含10000个单词的文档图像,经过视觉化后的token量就少了一半,再经过图像压缩,则可能只需要几百个视觉token,而如果以文本形式输入则需要10000多个文本token。这种“视觉模态天然就是文本信息的高效压缩媒介”的认知,催生了DeepSeek-OCR这个项目。
要实现光学压缩,团队需要一个前所未有的视觉编码器。它必须能处理高分辨率输入(因为文本图像包含海量细节),产生尽可能少的视觉token。同时,这个过程中,激活内存要够低(否则就失去了优化的意义)。
论文明确指出,当时所有的主流VLM架构(如Vary、InternVL2、Qwen2-VL)都无法同时满足这三点。
为此,DeepSeek-AI设计了这篇论文的第一个核心技术创新:DeepEncoder。
总的来说,DeepSeek-OCR的开源为OCR领域带来了新的视角和可能性。通过光学压缩技术,它成功地在不牺牲太多准确率的情况下实现了显著的上下文压缩。这不仅提高了模型的效率,也为未来的研究开辟了新的方向。
本文由主机测评网于2026-05-06发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260543089.html