DeepSeek-OCR开源新模型发布:以极低视觉Token实现高效长文本压缩,重新定义OCR与大模型协同范式

10.20 DeepSeek-OCR的出现,并非简单地在精度上超越前辈,而是开创了一种以视觉压缩文本的新范式,将OCR技术从单纯的文本识别工具,转变为大语言模型高效处理长上下文的视觉记忆接口

10月20日消息,今日,DeepSeek-AI团队正式发布其最新研究成果——《DeepSeek-OCR:Contexts Optical Compression》论文,并同步开源了该模型。这一创新性工作提出了一种利用视觉模态来压缩长文本上下文的全新方法,旨在从大语言模型(LLM)的视角重新审视视觉编码器的角色,为历史文档处理、大模型记忆机制研究及大规模多模态数据生成开辟了新路径。


fig1_20251020_17609492768167030

 

DeepSeek-OCR的核心由两部分构成:专为高分辨率输入设计的DeepEncoder编码器,以及名为DeepSeek3B-MoE-A570M的30亿参数解码器。其中,DeepEncoder的关键优势在于,它能在保持极低计算激活的同时,实现高压缩比,从而将视觉token的数量控制在可管理的范围内。这种设计巧妙地平衡了计算效率与信息保留,是其性能卓越的基础。

 

模型的性能表现尤为亮眼。实验数据显示,在文本token数量不超过视觉token 10倍(即压缩比低于10×)的条件下,DeepSeek-OCR的OCR精度高达97%。即使在更为严苛的20倍压缩比下,其准确率仍能维持在约60%的水平,展现了强大的鲁棒性和应用潜力。


show3

 

在权威的OmniDocBench基准测试中,DeepSeek-OCR的效率优势得到了进一步验证。仅使用100个视觉token,其性能便超越了GOT-OCR2.0(后者每页需256个token);而当视觉token数量不到800个时,其表现已优于MinerU2.0(平均每页消耗超过6000个token)。这一对比凸显了DeepSeek-OCR在资源利用效率上的革命性突破。

 

作为背景,GOT-OCR2.0以其端到端的统一架构和混合分辨率处理能力著称,能高效处理复杂文档;而MinerU2系列则在公式密集、布局复杂的PDF文档解析上表现突出,通过多尺度图像处理策略优化了识别精度与速度。DeepSeek-OCR的出现,并非简单地在精度上超越前辈,而是开创了一种“以视觉压缩文本”的新范式,将OCR技术从单纯的文本识别工具,转变为大语言模型高效处理长上下文的“视觉记忆”接口。


show4

 

在实际应用层面,DeepSeek-OCR的生产力同样惊人。据团队介绍,该模型可在单块A100-40G显卡上,实现每天超过20万页的大语言模型/视觉语言模型训练数据的生成,为多模态AI的规模化训练提供了强大的数据引擎。

 

综上所述,DeepSeek-OCR不仅是一项技术上的重大创新,更可能引领OCR技术与大语言模型协同发展的新方向,其开源也将为学术界和工业界带来深远影响。


https://github.com/deepseek-ai/DeepSeek-OCR 

https://huggingface.co/deepseek-ai/DeepSeek-OCR