DeepSeek-OCR2解读:视觉因果流之探索

作者:袖梨 2026-07-27

安哲罗普洛斯在《雾中风景》里用长达几分钟的长镜头,跟着两个孩子在雾里慢慢走向那棵模糊的树 —— 人类的视觉阅读从来都不是从左到右的机械扫描,而是像在雾里找路一样,跟着语义的线索一步步摸索,每一次视线的停留都和之前的感知因果相连。

ImageImage

我们看一份满是公式和表格的论文,不会从第一行第一个字机械地读到最后一行,而是会先扫过标题,找到摘要,再顺着公式的推导逻辑跳读,或是盯着表格里的关键数据 —— 这是人类视觉的因果流,由语义驱动的灵活扫描。但直到 DeepSeek-OCR2 出现,大部分视觉语言模型(VLMs)还在像印刷机一样,把图像切成补丁后按从上到下、从左到右的固定顺序喂给大模型,就像把雾里的风景拆成一个个像素块,按排列顺序硬塞给你,却不管你能不能看懂那片雾里的逻辑。

一、打破机械扫描的藩篱

传统的 OCR 模型,甚至是很多视觉语言模型,都在使用一种叫 “raster-scan” 的顺序处理视觉 token—— 就像你小时候用铅笔在本子上从左到右、从上到下写字一样,把图像切成小补丁后,按空间位置硬排成一维序列,再加上固定的位置编码喂给大模型。这就像把《死者田园祭》里那些碎片式的场景按拍摄顺序重新拼接,完全打乱了寺山修司藏在画面里的语义因果 —— 那些倒放的场景、重叠的记忆,本来是跟着情绪和逻辑走的,硬按顺序排列就成了一堆看不懂的碎片。

ImageImage

DeepSeek-OCR2 的核心创新,就是提出了 DeepEncoder V2,它想让模型学会像人类一样,跟着语义的因果来重新排列视觉 token。就像你看《死者田园祭》时,会跟着主角的记忆线索把那些碎片拼出完整的故事,DeepEncoder V2 会根据图像的语义,动态调整视觉 token 的顺序,再喂给大模型。

二、DeepEncoder V2:视觉因果流的核心

DeepEncoder V2 的设计完全重构了传统的视觉编码器,它把 CLIP 组件换成了 LLM 风格的架构,用一种双向注意力和因果注意力结合的机制,让模型学会 “按语义顺序看图像”。

1. 从 CLIP 到 LLM 架构的转变

原来的 DeepEncoder 用的是 CLIP 的 ViT 结构,而 DeepEncoder V2 直接换成了类似 Qwen2-0.5B 的 LLM 架构,把视觉 token 作为前缀拼接到因果查询 token 前面,让视觉 token 保持全局的双向注意力(就像人类的 peripheral vision,能看到整个画面),而因果查询 token 用因果注意力(就像人类的 foveal vision,跟着语义线索一步步聚焦)。

ImageImage

这种设计就像你看一幅画,先扫一眼整个画面(双向注意力),然后跟着画面里的故事线,从一个焦点移到下一个焦点(因果注意力),而不是从左上角开始机械地看每一个像素。

2. 因果流查询:让视觉 token 按语义排序

DeepEncoder V2 设计了和视觉 token 数量相等的因果查询 token,这些 token 就像你看电影时的 “视线引导者”,会根据图像的语义,把视觉 token 重新排列。比如看一份表格,它会先把表头的 token 排在前面,再按行的顺序排列内容,而不是按表格的空间位置从上到下硬排。

为了适配不同分辨率的图像,模型用了多裁剪策略:全局视图用 1024×1024 的分辨率,对应 256 个查询 token;局部裁剪用 768×768 的分辨率,最多可以有 6 个局部视图,每个局部视图对应 144 个查询 token,这样总 token 数在 256 到 1120 之间,刚好和 Gemini-3 Pro 的视觉 token 上限一致。

ImageImage

3. 注意力掩码:双向与因果的结合

DeepEncoder V2 的注意力掩码分成两部分:左边是视觉 token 的双向注意力掩码,让每个视觉 token 都能看到其他所有视觉 token;右边是因果查询 token 的下三角掩码,让每个查询 token 只能看到前面的查询 token 和所有视觉 token。

ImageImage

这种设计就像你在看一本带注释的书,正文部分你可以前后翻着看(双向注意力),而注释部分你只能顺着正文的顺序看(因果注意力),不会提前看到后面的注释打乱你的理解。

三、实验结果:语义顺序的胜利

在 OmniDocBench v1.5 这个包含 1355 份文档的基准测试上,DeepSeek-OCR2 的整体准确率达到了 91.09%,比原来的 DeepSeek-OCR 提升了 3.73%。更重要的是,阅读顺序的编辑距离(R-order ED)从 0.085 降到了 0.057,说明模型真的学会了按语义顺序来阅读文档,而不是按空间位置机械扫描。

在实际生产环境中,DeepSeek-OCR2 的重复率也从原来的 6.25% 降到了 4.17%(在线用户图片),PDF 数据生产的重复率从 3.69% 降到了 2.88%,说明这种语义排序的方式确实减少了模型的重复输出,让输出更符合人类的阅读逻辑。

四、不止于 OCR:2D 推理的新路径

DeepSeek-OCR2 的设计其实提出了一个更宏大的问题:能不能用两个串联的 1D 因果推理结构来实现真正的 2D 图像理解?

传统的视觉模型都是把 2D 图像压成 1D 序列,然后用大模型处理,就像把一幅画拆成线条按顺序排列,不管画里的故事是什么。而 DeepSeek-OCR2 的做法是,先让编码器把 2D 图像按语义排成 1D 的因果序列,再让大模型处理这个序列 —— 这就像先把一幅画按故事线剪成一个个镜头,再按顺序播放,这样大模型就能看懂画里的故事了。

这种思路其实和电影的叙事逻辑很像:寺山修司在《死者田园祭》里用碎片式的场景拼接,却能让观众跟着主角的记忆线索看懂整个故事,就是因为这些碎片是按因果顺序排列的,而不是按拍摄顺序。DeepSeek-OCR2 的因果流查询,就像电影里的剪辑师,把视觉碎片按语义因果拼出完整的故事。

另外,DeepEncoder V2 的架构还为原生多模态打开了新的可能:同一个编码器可以用不同的查询 token 来处理图像、音频、文本,就像同一个剪辑师可以用不同的剪辑手法处理不同类型的素材,最终都能按因果顺序呈现给观众。

五、结尾:雾里的路还在延伸

DeepSeek-OCR2 的创新,本质上是让模型更接近人类的视觉认知过程 —— 不是机械地扫描,而是跟着语义的因果流一步步探索。就像《雾中风景》里的两个孩子,虽然走在雾里,但他们跟着心里的线索一步步靠近目标,而不是按地图上的坐标机械地走。

未来的多模态模型,可能会越来越像一个会 “看电影” 的观众,能看懂画面里的因果逻辑,而不是像一个只会 “读字幕” 的机器,只能按顺序读取一个个单词。这种转变,可能会让模型真正理解视觉内容里的故事,而不是只是把图像转换成文字。

就像寺山修司在《死者田园祭》的结尾,主角烧掉了自己的家,走向未知的未来 ——DeepSeek-OCR2 的探索也只是一个开始,未来的视觉语言模型,会在雾里走出一条更接近人类认知的路。

本文参与腾讯云自媒体同步曝光计划,分享自微信公众号。原始发表:2026-02-04,如有侵权请联系[email protected] 删除

相关文章

精彩推荐