MinerU2.5 技术报告解读:解耦两阶段的高精度文档解析模型

解读上海 AI 实验室 MinerU2.5 如何用 1.2B 参数在文档解析上超越通用多模态大模型:把全局布局分析与局部内容识别解耦为两阶段,在 OmniDocBench 等主流基准全面领先,并梳理其数据引擎与评估优化。

报告概述

日前,上海人工智能实验室(上海AI实验室)全面上线新一代文档解析大模型——MinerU2.5,其核心创新在于采用解耦的两阶段解析策略,将全局布局分析与局部内容识别分离,既保证了高精度又显著提升了计算效率。该模型以1.2B参数规模,在布局检测、文本识别、表格识别、公式识别等核心任务上取得全面突破,在文档解析主流评测基准OmniDocBench、olmOCR-bench及Ocean-OCR上均取得优异成绩,超越Gemini2.5-Pro、GPT-4o、Qwen2.5-VL-72B等多模态通用大模型以及dots.ocr、MonkeyOCR、PP-StructureV3等文档解析专业模型和工具。

技术报告:https://arxiv.org/abs/2509.22186

开源项目:https://github.com/opendatalab/MinerU

开源模型:https://huggingface.co/opendatalab/MinerU2.5-2509-1.2B

在线使用:https://mineru.net/OpenSourceTools/Extractor

模型架构与核心设计

MinerU2.5的架构基于Qwen2-VL框架,包含三个核心组件:

  • 语言模型:采用50亿参数的Qwen2-Instruct解码器(从Qwen2-Instruct-0.5B初始化),使用M-RoPE适配多分辨率输入;
  • 视觉编码器:基于NaViT的6.75亿参数编码器(从Qwen2-VL-2B-Instruct初始化),采用2D-RoPE进行位置编码,支持动态分辨率处理;
  • 图像块合并器(Patch Merger):在效率和性能之间取得平衡,通过相邻的2×2视觉token上使用像素反洗牌(pixel-unshuffle),优化计算效率。
    ▲MinerU2.5 技术架构

两阶段解析策略

  1. 阶段一(布局分析):将输入图像统一降采样至1036×1036像素,快速提取文档结构(如段落、表格、公式区域),避免高分辨率计算开销——过小会导致细节丢失,过大则会触发NaViT的二次复杂度
  2. 阶段二(内容识别):根据布局结果裁剪原图区域(最高分辨率2048×28×28像素),分别进行文本、公式和表格的精细识别,保留细节信息——避免了因裁剪区域过小而导致的细节丢失,又防止了因区域过大而产生的冗余计算

    训练与数据引擎

三阶段训练流程

  1. 模态对齐:使用视觉问答(VQA)数据对齐视觉与语言表征;
  2. 文档解析预训练:在大规模自动标注数据上学习布局分析与内容识别;
  3. 文档解析微调:针对难样本(如复杂表格、多语言公式)进行定向优化。

数据引擎构建

数据引擎通过多步骤保障数据质量与多样性:

  1. 数据筛选:从海量文档中基于布局、类型、元素平衡和语言分布筛选高质量样本;
  2. 自动化标注与修正:利用专家模型(如Qwen2.5-VL、UniMERNet)提升文本、公式和表格的标注精度;
  3. 难样本挖掘(IMIC(基于推理一致性的迭代挖掘)策略):通过多次推断结果的一致性识别模型薄弱点,优先进行人工标注。

任务创新与评估优化

1. 布局分析

  • 统一标注体系:涵盖页眉、页脚、代码块等非主体内容,支持细粒度元素分类;
  • 多任务范式:同步预测位置、类别、旋转角和阅读顺序;
  • PageIoU指标:替代传统mAP,基于页面级覆盖度评估布局一致性,更符合人类视觉判断。

2. 公式识别

  • 原子-复合公式分解(ADR):将复杂公式拆分为原子单元(如单行公式)分别识别,再重组为完整结构,避免结构幻觉问题;
  • 多语言支持:精准处理中英文混合公式。

3. 表格识别

  • OTSL中间表示:简化HTML结构,减少50%的序列长度,提升模型生成效率;
  • 几何校正:自动检测表格旋转角度并校正,支持无框线、部分框线等复杂场景。

性能评估与效果评估

通过vLLM优化异步推理,MinerU2.5的吞吐量达2.12页/秒,比MonkeyOCR-Pro-3B快4倍,比dots.ocr快7倍,且支持动态调整生成参数以适应不同内容类型(如降低表格生成的惩罚系数)

从评测结果来看,在权威的OmniDocBench基准测试中,MinerU2.5取得结果最优(SOTA),在布局检测、文本识别、表格识别、公式识别等关键指标上超越Gemini 2.5-Pro、GPT-4o等国际顶尖模型,对比开源文档解析方案(如MonkeyOCR、PP-StructureV3),MinerU2.5在解析精度、结构完整性和格式自然度方面同样处于优势地位。相关评测结果已在团队最新公开的技术报告中发布。

▲OmniDocBench中的评测结果

▲OmniDocBench中的评测排名

结论与意义

MinerU2.5通过解耦架构和系统化数据工程,实现了文档解析领域效率与精度的双重突破。其轻量化设计(1.2B参数)使其适合实际部署,而保留语义完整性的输出(如表格结构、公式逻辑)为RAG系统和大模型预训练提供了高质量结构化数据来源。未来,该框架有望推动多模态文档理解在学术、金融、出版等领域的广泛应用。

参考资料

1、https://mp.weixin.qq.com/s/OAke8qjiiAGzwoL8QjDddA

2、https://mp.weixin.qq.com/s/jOXWbOvypIorliIXow-Hzw

本文结束 感谢您的阅读