解读百度 PaddleOCR-VL:由 NaViT 风格动态分辨率视觉编码器与 ERNIE-4.5-0.3B 语言模型组成的 0.9B 视觉语言模型,覆盖 109 种语言,在文本识别、公式识别、表格理解与阅读顺序四项核心能力上取得 SOTA。

PaddleOCR-VL 是一款先进、高效的文档解析模型,专为文档中的元素识别设计。其核心组件为 PaddleOCR-VL-0.9B,这是一种紧凑而强大的视觉语言模型(VLM),它由 NaViT 风格的动态分辨率视觉编码器与 ERNIE-4.5-0.3B 语言模型组成,能够实现精准的元素识别。
PaddleOCR-VL覆盖多达109种语言,无论是中文、英文等主流语言,还是小语种,都能实现轻松处理。与其他同类模型相比,PaddleOCR-VL不仅识别效果更好,资源消耗也非常低,速度快,效率高。这款模型不仅得分高,还在文本识别、公式识别、表格理解、阅读顺序四大核心能力上全面拿下SOTA。
代码:https://github.com/PaddlePaddle/PaddleOCR
模型:https://www.modelscope.cn/models/PaddlePaddle/PaddleOCR-VL
技术报告:https://ernie.baidu.com/blog/publication/PaddleOCR-VL_Technical_Report.pdf
体验Demo:https://www.modelscope.cn/studios/PaddlePaddle/PaddleOCR-VL_Online_Demo

核心亮点
传统文档AI模型往往需要在速度与精度间进行权衡,而PaddleOCR-VL实现了二者的平衡。
- 动态视觉编码器:采用NaViT风格架构,高效处理高分辨率图像;
- 轻量语言模型:基于ERNIE-4.5–0.3B,提供优质语义理解能力;
- 文档解析的SOTA表现:PaddleOCR-VL在文档解析任务中取得最先进的性能。它在识别包含表格、公式和图表等元素的复杂文档方面表现优异,擅长手写文本与历史文档在内的多种挑战性内容类型;
- 支持109种语言的文字识别:覆盖主要通用语言及多样书写体系(如俄语、阿拉伯语、印地语等),PaddleOCR-VL在多语种与全球化文档处理场景中具有广泛适用性。
技术架构

PaddleOCR-VL将复杂的文档解析任务分解为两个阶段。
阶段1:PP-DocLayoutV2,负责布局分析,定位语义区域并预测其阅读顺序。PP-DocLayoutV2结构由RT-DETR以及一个具有六个transformer层的轻量级指针网络,以准确预测布局元素的阅读顺序。

训练方法:版式分析(目标检测)初始化权重:PP-DocLayout_Plus-L,使用2w数据量训练100轮。阅读顺序:模型输出一个矩阵,表示任意两个元素之间的成对排序关系。
阶段2:PaddleOCR-VL-0.9B对文本、表格、公式和图表进行ocr format。模型结构类似LLaVA:
- 视觉编码器:使用NaViT结构,从Keye-VL模型初始化,支持原生分辨率输入(任意分辨率的图像而不会失真,从而减少幻觉);
- 连接器:随机初始化的2层MLP;
- 解码器:ERNIE-4.5-0.3B,引入3D-RoPE进一步增强了位置表示。

训练与数据引擎
训练方法分两阶段,阶段1的模态对齐与阶段2的激发ocr format能力
- OCR:文本识别
- 表格识别:输出为以 OTSL 格式(采用 OTSL 是因为它相较于HTML 作为视觉语言模型的目标具有显著优势。其极简设计具有与表格视觉二维矩阵直接的结构对应关系,将结构 token 数量从超过 28 个减少到仅 5 个,并将平均序列长度缩短约50%。这使得它成为模型生成时更高效的输出目标。最后一阶段是将 OTSL 输出简单转换为标准HTML);
- 公式识别:转换为结构化的LATEX格式;
- 图表识别:各种类型的图表中识别信息,如条形图、折线图和饼图,并将其转换为Markdown格式表格。

整个模型虽然只有0.9B参数量,但在训练过程中,共使用超3000万样本。训练数据涵盖文本、表格、公式、图表等多模态信息,数据来源包括公开数据、自动合成数据、互联网采样数据和百度自研数据,辅以难例挖掘机制,保证训练集的多样性和挑战性。

性能评估与效果评估
下表展示了不同文档解析模型在A100上的端到端推理速度。凭借轻量化的模型结构,PaddleOCR-VL每秒可处理 1881 个Token,推理速度较MinerU2.5提升14.2%,较 dots.ocr 提升253.01%。在当前主流开源多模态 OCR 方案中,PaddleOCR-VL 展现出显著的速度优势。





