跳到正文
孔明の博客

AI 大模型研发与应用


  • Home

  • Archives

  • Search

PaddleOCR-VL 技术报告解读:0.9B 紧凑视觉语言文档解析模型

Posted on 2025-10-22 | In 文档理解与知识抽取 , 文档解析与 OCR 技术 | 1.2k | 4 分钟
解读百度 PaddleOCR-VL:由 NaViT 风格动态分辨率视觉编码器与 ERNIE-4.5-0.3B 语言模型组成的 0.9B 视觉语言模型,覆盖 109 种语言,在文本识别、公式识别、表格理解与阅读顺序四项核心能力上取得 SOTA。
Read more »

DeepSeek-OCR 技术报告解读:用光学方式压缩文本上下文

Posted on 2025-10-22 | In 文档理解与知识抽取 , 文档解析与 OCR 技术 | 992 | 3 分钟
DeepSeek-OCR 提出以光学方式压缩文本上下文:把长文本渲染成图像,用远少于数字文本的视觉 token 来表示,从而缓解长序列的平方级计算开销。本文解读其任务定义、DeepEncoder 架构、数据工程与训练流程。
Read more »

Qwen3-VL 梳理:模型架构、版本更新与部署要点

Posted on 2025-09-25 | In 大模型全栈知识 , 多模态技术梳理 | 601 | 3 分钟
梳理 Qwen3-VL 的发布脉络与工程要点:235B-A22B 的 Instruct 与 Thinking 版本、模型架构与在线服务形态,以及 FP8 量化对 H100 及以上显卡与 CUDA 版本的要求。
Read more »

主流文档解析专用模型横评:MinerU、Docling、PaddleOCR 等

Posted on 2025-09-22 | In 文档理解与知识抽取 , 文档解析与 OCR 技术 | 167 | 1 分钟
横向对比 MinerU、Docling、PaddleOCR、DolphinOCR、MonkeyOCR 等主流文档解析方案,梳理文档结构识别技术从传统视觉模型到生成式 Transformer 架构的两代演进,以及各自在 RAG 场景下的适配情况。
Read more »

Qwen-VL 1.0 解读:视觉感知器与基础视觉语言对齐

Posted on 2025-09-11 | In 大模型全栈知识 , 多模态技术梳理 | 316 | 1 分钟
解读 Qwen-VL 如何以 Qwen-7B 为基座引入视觉感知器完成基础视觉语言对齐,梳理其视觉编码器设计、位置感知适配器的作用与训练流程,并给出源码与工程实现的参考资料。
Read more »

Qwen-VL 系列架构演进梳理:从固定分辨率到统一时空理解

Posted on 2025-09-11 | In 大模型全栈知识 , 多模态技术梳理 | 1.2k | 4 分钟
用对比表格梳理 Qwen-VL 系列的架构演进:从 Qwen-VL 的固定分辨率 ViT,到 Qwen2-VL 引入 NaViT 动态分辨率与 2D-RoPE,再到 Qwen2.5-VL 重新设计的窗口注意力 ViT,覆盖视觉编码器、跨模态连接机制与训练策略的差异。
Read more »

GloVe 详解:基于全局词频统计的词向量与公式推导

Posted on 2025-09-08 | In NLP技术全景 , 文本表示与词嵌入技术 | 2.1k | 7 分钟
讲解 GloVe(Global Vectors)词向量:基于全局词频统计构造共现矩阵并拟合词向量,使向量运算能表达词语的相似性与类比关系,并给出目标函数推导及与 LSA、word2vec 的对比。
Read more »

NNLM 神经概率语言模型详解:分布式词表示的开山之作

Posted on 2025-09-08 | In NLP技术全景 , 文本表示与词嵌入技术 | 1.5k | 6 分钟
讲解 Bengio 等人提出的神经概率语言模型:通过学习单词的分布式表示与词序列概率函数缓解维度灾难,用神经网络改进 n-gram 模型以利用更长的上下文,是后续 word2vec 等词向量工作的起点。
Read more »

向量索引算法综述:四种度量方式与主流索引结构

Posted on 2025-09-08 | In NLP技术全景 , 信息检索与搜索技术 | 4.2k | 15 分钟
系统梳理向量检索:欧式距离、余弦、内积与海明距离四种度量方式的适用场景,以及暴力计算、基于树、基于哈希、基于倒排与基于图等索引结构在减少候选集与降低单向量计算复杂度上的取舍。
Read more »

RAG 重排序 Rerank 详解:从向量召回到交叉编码精排

Posted on 2025-09-08 | In NLP技术全景 , 信息检索与搜索技术 | 854 | 2 分钟
讲解检索系统中的重排序环节:为什么需要 rerank、交叉编码模型的原理与输入长度限制、如何用大语言模型充当 ranker,以及向量召回与精排配合提升命中率的工程实践。
Read more »

隐马尔可夫模型 HMM 详解:定义、三个基本问题与算法推导

Posted on 2025-09-08 | In NLP技术全景 , 传统机器学习与概率图模型 | 8.3k | 36 分钟
系统讲解隐马尔可夫模型:从马尔可夫过程与 HMM 的形式化定义出发,详细推导评估观测序列概率的前向后向算法、解码隐藏状态序列的维特比算法,以及参数学习的 Baum-Welch 算法。
Read more »

LLM 领域重要论文清单:从 Transformer 到前沿探索

Posted on 2025-09-08 | In 大模型全栈知识 , 模型认知与生态 | 7k | 26 分钟
按奠基理论、里程碑突破、核心架构与方法、重要优化与应用、前沿探索五个维度梳理大语言模型领域的代表性论文,逐篇给出链接、主要内容与影响,可作为系统入门的阅读路线。
Read more »
1…456…16
戈孔明

戈孔明

185 posts
50 categories
736 tags
GitHub E-Mail
我的平台
  • 个人博客
  • 知识库
© 2020 — 2026 戈孔明 | 531.7k 赣ICP备20004005号
0%