技术地图

技术地图

我掌握什么 — 大模型工程化能力体系全景图,按核心能力方向组织,每个技术节点关联对应的深度文章。


能力体系总览

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
┌─────────────────────────────────────────────────────────────────┐
│ 大模型工程化能力体系 │
├─────────────────────────────────────────────────────────────────┤
│ │
│ ┌──────────────┐ ┌──────────────┐ ┌──────────────────────┐ │
│ │ LLM 大模型 │ │ Agent 工程化 │ │ RAG 检索增强 │ │
│ │ 架构·训练·推理│ │ 单/多Agent │ │ 向量检索·知识库 │ │
│ └──────────────┘ └──────────────┘ └──────────────────────┘ │
│ │
│ ┌──────────────┐ ┌──────────────┐ │
│ │ Document AI │ │ AI Infra │ ┌──────────────────────┐ │
│ │ 文档理解·OCR │ │ GPU·容器·编排│ │ 技术根基 │ │
│ └──────────────┘ └──────────────┘ │ NLP·CV·数学·工程 │ │
│ └──────────────────────┘ │
└─────────────────────────────────────────────────────────────────┘

三层结构:


一、LLM 大模型

模型架构 · 训练对齐 · 推理优化 — 大模型全栈技术能力

1.1 模型架构

技术方向核心内容代表文章
Transformer 机制注意力、位置编码、激活函数、归一化从 MHA 到 MLA:KV Cache 演进
MoE 稀疏架构专家路由、负载均衡、DeepSeek MoEDeepSeek-V3.2 技术报告解读
长上下文位置编码外推、线性注意力、KV Cache 压缩线性注意力机制
多模态视觉语言模型、全模态、文档理解Qwen3-VL 多模态

关键技术标签: Transformer MoE 注意力机制 RoPE SwiGLU RMSNorm 长上下文 多模态

1.2 训练与对齐

技术方向核心内容代表文章
预训练数据工程、优化器、混合精度Muon 优化器
后训练 SFT指令微调、LoRA/QLoRALoRA 低秩适配
对齐技术RLHF、PPO、DPO、GRPORLHF 全流程与 PPO 源码解读
分布式训练数据/张量/流水线/序列并行分布式训练并行策略总览

关键技术标签: 预训练 SFT RLHF PPO DPO GRPO LoRA 分布式训练 ZeRO DeepSpeed

1.3 推理优化

技术方向核心内容代表文章
推理框架vLLM、SGLang、TGI、FasterTransformervLLM 部署 Qwen3-235B 实践
核心机制PagedAttention、Continuous Batching、Chunked PrefillPagedAttention 与 Continuous Batching 源码解读
KV CacheMHA→MQA→GQA→MLA 演进、压缩、量化从 MHA 到 MLA:KV Cache 演进
量化压缩GPTQ、AWQ、FP8、DeepGEMM模型压缩三剑客:量化、蒸馏与剪枝
解码加速投机解码、FlashAttention、FlashInfer投机解码技术
推理服务化OpenAI API、负载均衡、监控、容量规划推理服务化实践

关键技术标签: vLLM SGLang PagedAttention KV Cache MLA 量化 FP8 投机解码 FlashAttention 分布式推理


二、Agent 工程化

单 Agent · 多 Agent · MCP · Workflow — 从 Demo 到企业落地

2.1 Agent 设计模式

模式核心思想适用场景
ReAct推理与行动交替需要工具调用的任务
Plan-and-Execute先规划后执行复杂多步骤任务
Reflexion自我反思迭代需要质量优化的任务
Agentic RAG检索增强 + Agent 决策知识库问答

代表文章:

2.2 多 Agent 协作

技术方向核心内容代表文章
框架选型AutoGen、LangGraph、CrewAI 对比多智能体框架:五大主流框架选型对比
协作模式辩论、协作、层级、角色划分多智能体协作
编排调度DAG 编排、状态机、错误恢复编排与调度机制

关键技术标签: Multi-Agent AutoGen LangGraph CrewAI Workflow 编排调度

2.3 MCP 协议

技术方向核心内容
协议基础Model Context Protocol,统一上下文接入标准
Server 端工具暴露、资源管理、提示词定义
Client 端模型侧接入、上下文管理

代表文章:

关键技术标签: MCP 协议 工具接入 上下文工程

2.4 工具调用与上下文工程

技术方向核心内容
Function Calling结构化输出、参数校验、重试机制
记忆机制短期记忆、长期记忆、向量记忆
Prompt 工程提示词设计、上下文压缩、系统提示
人机协同Human-in-the-loop、审批流程

关键技术标签: 工具调用 记忆机制 提示工程 上下文工程


三、RAG 检索增强

向量检索 · 混合检索 · Rerank · 知识库治理 — 企业级 RAG 全链路

3.1 检索基础

技术方向核心内容代表文章
词嵌入Word2vec、GloVe、FastText、Sentence-BERTGloVe 详解:全局词频统计的词向量
向量检索HNSW、IVF、PQ、近似最近邻向量索引算法综述:四种度量方式与主流索引
传统检索TF-IDF、BM25、倒排索引BM25 算法详解
向量数据库Milvus、Qdrant、Weaviate、ElasticsearchElasticsearch 实战

关键技术标签: 词嵌入 向量检索 BM25 倒排索引 HNSW

3.2 检索优化

技术方向核心内容代表文章
混合检索Dense + Sparse,语义匹配 + 精确匹配混合检索实践
查询改写Query Rewriting、HyDE、多查询查询改写技术
重排序 RerankCross-Encoder、BGE-Reranker、精排RAG 重排序 Rerank 详解:从向量召回到精排
答案溯源引用标注、可信度评估、幻觉降低降低幻觉技术

关键技术标签: 混合检索 查询改写 Rerank 重排序 答案溯源

3.3 知识库治理

技术方向核心内容
文档解析PDF/Word/PPT/表格/图片,多格式处理
分块策略语义分块、递归字符分块、重叠窗口
元数据管理文档来源、更新时间、作者、权限
权限控制用户角色、文档级/块级权限过滤
增量更新文档变更触发重新解析和向量化

关键技术标签: RAG 知识库 分块策略 元数据 权限控制


四、Document AI 文档理解

文档解析 · 版面分析 · OCR · 多模态理解 — 复杂文档结构化提取

4.1 文档解析模型

模型特点代表文章
MinerU开源 PDF 解析,表格/公式提取MinerU 技术
PaddleOCR-VL多模态文档理解,复杂版面PaddleOCR-VL 部署实战:Docker 与 vLLM
dots.ocr基于 vLLM 部署,推理效率高dots.ocr 部署实战:推理服务与解析流程
DoclingIBM 开源,多格式支持主流文档解析模型横评
DeepSeek-OCRDeepSeek 文档理解模型DeepSeek-OCR

代表文章:

4.2 版面分析与结构化提取

技术方向核心内容
区域检测文本、表格、图片、公式区域识别
表格识别行列结构、单元格内容、HTML/Markdown 输出
公式识别LaTeX 输出、行内/块级公式区分
阅读顺序多栏排版、复杂布局、文本流重建
图表理解图表标题、数据点、语义描述

4.3 多模态文档理解

技术方向核心内容
视觉语言模型VLM 在文档理解中的应用
文档理解评测OmniDocBench 等基准测试
输出格式Markdown、JSON、结构化文档、可搜索 PDF
推理服务化vLLM 部署、批量处理、API 接口

关键技术标签: Document AI OCR 版面分析 表格识别 公式识别 多模态 PaddleOCR-VL dots.ocr MinerU


五、AI Infra 基础设施

GPU 集群 · 容器化 · 编排调度 · 监控运维 — 大模型服务稳定高效运行

5.1 GPU 集群与通信

技术方向核心内容
GPU 硬件A100、H20、NVLink、NVSwitch
NCCL 通信AllReduce、AllGather、集合通信原语
分布式存储3FS 等高性能文件系统
GPU 架构Ampere、Hopper、Blackwell 架构特性

关键技术标签: GPU NVLink NVSwitch NCCL GPU架构

5.2 容器化与编排

技术方向核心内容
Docker镜像构建、环境管理、容器化部署
Kubernetes容器编排、Pod 管理、Service、Ingress
模型服务编排模型部署、自动扩缩容、滚动更新
服务网格流量管理、服务发现、负载均衡

关键技术标签: Docker Kubernetes 容器化 模型服务化 负载均衡

5.3 监控运维与容量规划

技术方向核心内容
GPU 监控利用率、显存、温度、功耗监控
推理指标TTFT、TPOT、Throughput、延迟监控
告警系统阈值告警、异常检测、通知机制
容量规划根据并发量和上下文长度估算 GPU 需求
高可用多副本、故障转移、灾备方案

关键技术标签: 监控告警 容量规划 高可用 推理服务化


六、技术根基

NLP · CV · 数学 · 工程基础 — 底层技术能力支撑

6.1 NLP 基础

  • 文本表示:词嵌入、句嵌入、文档嵌入
  • 文本分类:TextCNN、TextRNN、TextRCNN、Text-GCN
  • 信息检索:TF-IDF、BM25、向量检索、相关性排序
  • 序列标注:NER、分词、词性标注

代表文章: GloVe 详解BM25 算法详解

6.2 深度学习与 CV

  • 经典网络:AlexNet、VGG、GoogLeNet、ResNet、NiN、FCN
  • 优化器:SGD、Momentum、Adam、Muon
  • 迁移学习:预训练模型微调、域适应
  • 计算机视觉:图像分类、目标检测、图像处理

代表文章: ResNet 深度残差网络详解神经网络优化器详解

6.3 数学与工程基础

  • 数学:线性代数、概率论与数理统计、微积分、最优化
  • 编程:Python、C++、MATLAB
  • 工具:Git、Linux、Markdown、LaTeX
  • 其他:密码学、计算机图形学

前沿模型跟踪

持续跟踪主流开源大模型的技术演进:

模型系列代表型号关注方向
DeepSeekV3/V4、R1MoE 架构、推理强化学习、稀疏注意力
QwenQwen3/3.5、Qwen3-VL、Qwen3.5-Omni全模态、长上下文、推理优化
GLMGLM-4.5V多模态、Agent 能力
GemmaGemma-3/4端侧模型、高效推理
MiniCPMMiniCPM-V、MiniCPM-o轻量级、全模态
其他Llama、Baichuan、InternLM、Phi、Ovis、Nex、MiniMax架构创新、训练技巧

代表文章:


学习路径建议

路径一:LLM 推理优化工程师

  1. 基础:Transformer 架构 → 注意力机制 → KV Cache
  2. 进阶:vLLM 源码 → PagedAttention → Continuous Batching
  3. 核心:量化压缩 → 投机解码 → 多卡分布式推理
  4. 实战:大模型部署 → 性能调优 → 推理服务化

路径二:Agent 工程师

  1. 基础:Prompt 工程 → Function Calling → ReAct
  2. 进阶:Agent 设计模式 → MCP 协议 → 记忆机制
  3. 核心:多 Agent 框架 → Workflow 编排 → 上下文工程
  4. 实战:单 Agent 应用 → 多 Agent 协作 → 企业级落地

路径三:AI 基础设施工程师

  1. 基础:Linux → Docker → Kubernetes
  2. 进阶:GPU 架构 → NCCL 通信 → 分布式训练
  3. 核心:模型服务化 → 监控告警 → 容量规划
  4. 实战:GPU 集群管理 → 推理平台搭建 → 高可用部署

本技术地图持续更新中。各方向的详细文章可通过 内容导航 按分类查阅,或通过 全部文章 按时间浏览。工程项目请查看 技术实践