全部子文章(7 篇)
- Glyph 技术报告解读:把长文本渲染成图像的上下文压缩方案Glyph 不再把文本当作离散 token 序列直接输入 LLM,而是先渲染成紧凑图像再用视觉语言模型处理,用一个视觉 token 承载数十个文本 token。本文解读其研究背景、技术架构与性能评估。
- dots.ocr 模型部署实战:基于 vLLM 的推理服务与解析流程记录 dots.ocr 的部署方式:自 vLLM 0.11.0 起已集成 Dots OCR,可直接用官方镜像启动模型服务器,并给出版面全解析、单图与单 PDF 解析的命令示例与提示词模式说明。
- dots.ocr 技术报告解读:单模型统一布局检测与内容识别解读 dots.ocr 如何用一个 17 亿参数的视觉语言模型统一文档布局检测与内容识别并保持正确阅读顺序:在 OmniDocBench 上取得文本、表格与阅读顺序的 SOTA,且对低资源语言有很强的解析能力。
- MinerU2.5 技术报告解读:解耦两阶段的高精度文档解析模型解读上海 AI 实验室 MinerU2.5 如何用 1.2B 参数在文档解析上超越通用多模态大模型:把全局布局分析与局部内容识别解耦为两阶段,在 OmniDocBench 等主流基准全面领先,并梳理其数据引擎与评估优化。
- PaddleOCR-VL 技术报告解读:0.9B 紧凑视觉语言文档解析模型解读百度 PaddleOCR-VL:由 NaViT 风格动态分辨率视觉编码器与 ERNIE-4.5-0.3B 语言模型组成的 0.9B 视觉语言模型,覆盖 109 种语言,在文本识别、公式识别、表格理解与阅读顺序四项核心能力上取得 SOTA...
- DeepSeek-OCR 技术报告解读:用光学方式压缩文本上下文DeepSeek-OCR 提出以光学方式压缩文本上下文:把长文本渲染成图像,用远少于数字文本的视觉 token 来表示,从而缓解长序列的平方级计算开销。本文解读其任务定义、DeepEncoder 架构、数据工程与训练流程。
- 文档解析模型部署实战:DeepSeek-OCR、PaddleOCR-VL与MinerU文档解析与OCR模型完整部署指南,覆盖DeepSeek-OCR、PaddleOCR-VL与MinerU三大主流方案,包含Docker镜像构建、vLLM推理服务启动与解析性能对比。