技术地图
我掌握什么 — 大模型工程化能力体系全景图,按核心能力方向组织,每个技术节点关联对应的深度文章。
能力体系总览
1 | ┌─────────────────────────────────────────────────────────────────┐ |
三层结构:
一、LLM 大模型
模型架构 · 训练对齐 · 推理优化 — 大模型全栈技术能力
1.1 模型架构
| 技术方向 | 核心内容 | 代表文章 |
|---|---|---|
| Transformer 机制 | 注意力、位置编码、激活函数、归一化 | 从 MHA 到 MLA:KV Cache 演进 |
| MoE 稀疏架构 | 专家路由、负载均衡、DeepSeek MoE | DeepSeek-V3.2 技术报告解读 |
| 长上下文 | 位置编码外推、线性注意力、KV Cache 压缩 | 线性注意力机制 |
| 多模态 | 视觉语言模型、全模态、文档理解 | Qwen3-VL 多模态 |
关键技术标签: Transformer MoE 注意力机制 RoPE SwiGLU RMSNorm 长上下文 多模态
1.2 训练与对齐
| 技术方向 | 核心内容 | 代表文章 |
|---|---|---|
| 预训练 | 数据工程、优化器、混合精度 | Muon 优化器 |
| 后训练 SFT | 指令微调、LoRA/QLoRA | LoRA 低秩适配 |
| 对齐技术 | RLHF、PPO、DPO、GRPO | RLHF 全流程与 PPO 源码解读 |
| 分布式训练 | 数据/张量/流水线/序列并行 | 分布式训练并行策略总览 |
关键技术标签: 预训练 SFT RLHF PPO DPO GRPO LoRA 分布式训练 ZeRO DeepSpeed
1.3 推理优化
| 技术方向 | 核心内容 | 代表文章 |
|---|---|---|
| 推理框架 | vLLM、SGLang、TGI、FasterTransformer | vLLM 部署 Qwen3-235B 实践 |
| 核心机制 | PagedAttention、Continuous Batching、Chunked Prefill | PagedAttention 与 Continuous Batching 源码解读 |
| KV Cache | MHA→MQA→GQA→MLA 演进、压缩、量化 | 从 MHA 到 MLA:KV Cache 演进 |
| 量化压缩 | GPTQ、AWQ、FP8、DeepGEMM | 模型压缩三剑客:量化、蒸馏与剪枝 |
| 解码加速 | 投机解码、FlashAttention、FlashInfer | 投机解码技术 |
| 推理服务化 | OpenAI API、负载均衡、监控、容量规划 | 推理服务化实践 |
关键技术标签: vLLM SGLang PagedAttention KV Cache MLA 量化 FP8 投机解码 FlashAttention 分布式推理
二、Agent 工程化
单 Agent · 多 Agent · MCP · Workflow — 从 Demo 到企业落地
2.1 Agent 设计模式
| 模式 | 核心思想 | 适用场景 |
|---|---|---|
| ReAct | 推理与行动交替 | 需要工具调用的任务 |
| Plan-and-Execute | 先规划后执行 | 复杂多步骤任务 |
| Reflexion | 自我反思迭代 | 需要质量优化的任务 |
| Agentic RAG | 检索增强 + Agent 决策 | 知识库问答 |
代表文章:
2.2 多 Agent 协作
| 技术方向 | 核心内容 | 代表文章 |
|---|---|---|
| 框架选型 | AutoGen、LangGraph、CrewAI 对比 | 多智能体框架:五大主流框架选型对比 |
| 协作模式 | 辩论、协作、层级、角色划分 | 多智能体协作 |
| 编排调度 | DAG 编排、状态机、错误恢复 | 编排与调度机制 |
关键技术标签: Multi-Agent AutoGen LangGraph CrewAI Workflow 编排调度
2.3 MCP 协议
| 技术方向 | 核心内容 |
|---|---|
| 协议基础 | Model Context Protocol,统一上下文接入标准 |
| Server 端 | 工具暴露、资源管理、提示词定义 |
| Client 端 | 模型侧接入、上下文管理 |
代表文章:
关键技术标签: MCP 协议 工具接入 上下文工程
2.4 工具调用与上下文工程
| 技术方向 | 核心内容 |
|---|---|
| Function Calling | 结构化输出、参数校验、重试机制 |
| 记忆机制 | 短期记忆、长期记忆、向量记忆 |
| Prompt 工程 | 提示词设计、上下文压缩、系统提示 |
| 人机协同 | Human-in-the-loop、审批流程 |
关键技术标签: 工具调用 记忆机制 提示工程 上下文工程
三、RAG 检索增强
向量检索 · 混合检索 · Rerank · 知识库治理 — 企业级 RAG 全链路
3.1 检索基础
| 技术方向 | 核心内容 | 代表文章 |
|---|---|---|
| 词嵌入 | Word2vec、GloVe、FastText、Sentence-BERT | GloVe 详解:全局词频统计的词向量 |
| 向量检索 | HNSW、IVF、PQ、近似最近邻 | 向量索引算法综述:四种度量方式与主流索引 |
| 传统检索 | TF-IDF、BM25、倒排索引 | BM25 算法详解 |
| 向量数据库 | Milvus、Qdrant、Weaviate、Elasticsearch | Elasticsearch 实战 |
关键技术标签: 词嵌入 向量检索 BM25 倒排索引 HNSW
3.2 检索优化
| 技术方向 | 核心内容 | 代表文章 |
|---|---|---|
| 混合检索 | Dense + Sparse,语义匹配 + 精确匹配 | 混合检索实践 |
| 查询改写 | Query Rewriting、HyDE、多查询 | 查询改写技术 |
| 重排序 Rerank | Cross-Encoder、BGE-Reranker、精排 | RAG 重排序 Rerank 详解:从向量召回到精排 |
| 答案溯源 | 引用标注、可信度评估、幻觉降低 | 降低幻觉技术 |
关键技术标签: 混合检索 查询改写 Rerank 重排序 答案溯源
3.3 知识库治理
| 技术方向 | 核心内容 |
|---|---|
| 文档解析 | PDF/Word/PPT/表格/图片,多格式处理 |
| 分块策略 | 语义分块、递归字符分块、重叠窗口 |
| 元数据管理 | 文档来源、更新时间、作者、权限 |
| 权限控制 | 用户角色、文档级/块级权限过滤 |
| 增量更新 | 文档变更触发重新解析和向量化 |
关键技术标签: RAG 知识库 分块策略 元数据 权限控制
四、Document AI 文档理解
文档解析 · 版面分析 · OCR · 多模态理解 — 复杂文档结构化提取
4.1 文档解析模型
| 模型 | 特点 | 代表文章 |
|---|---|---|
| MinerU | 开源 PDF 解析,表格/公式提取 | MinerU 技术 |
| PaddleOCR-VL | 多模态文档理解,复杂版面 | PaddleOCR-VL 部署实战:Docker 与 vLLM |
| dots.ocr | 基于 vLLM 部署,推理效率高 | dots.ocr 部署实战:推理服务与解析流程 |
| Docling | IBM 开源,多格式支持 | 主流文档解析模型横评 |
| DeepSeek-OCR | DeepSeek 文档理解模型 | DeepSeek-OCR |
代表文章:
4.2 版面分析与结构化提取
| 技术方向 | 核心内容 |
|---|---|
| 区域检测 | 文本、表格、图片、公式区域识别 |
| 表格识别 | 行列结构、单元格内容、HTML/Markdown 输出 |
| 公式识别 | LaTeX 输出、行内/块级公式区分 |
| 阅读顺序 | 多栏排版、复杂布局、文本流重建 |
| 图表理解 | 图表标题、数据点、语义描述 |
4.3 多模态文档理解
| 技术方向 | 核心内容 |
|---|---|
| 视觉语言模型 | VLM 在文档理解中的应用 |
| 文档理解评测 | OmniDocBench 等基准测试 |
| 输出格式 | Markdown、JSON、结构化文档、可搜索 PDF |
| 推理服务化 | vLLM 部署、批量处理、API 接口 |
关键技术标签: Document AI OCR 版面分析 表格识别 公式识别 多模态 PaddleOCR-VL dots.ocr MinerU
五、AI Infra 基础设施
GPU 集群 · 容器化 · 编排调度 · 监控运维 — 大模型服务稳定高效运行
5.1 GPU 集群与通信
| 技术方向 | 核心内容 |
|---|---|
| GPU 硬件 | A100、H20、NVLink、NVSwitch |
| NCCL 通信 | AllReduce、AllGather、集合通信原语 |
| 分布式存储 | 3FS 等高性能文件系统 |
| GPU 架构 | Ampere、Hopper、Blackwell 架构特性 |
关键技术标签: GPU NVLink NVSwitch NCCL GPU架构
5.2 容器化与编排
| 技术方向 | 核心内容 |
|---|---|
| Docker | 镜像构建、环境管理、容器化部署 |
| Kubernetes | 容器编排、Pod 管理、Service、Ingress |
| 模型服务编排 | 模型部署、自动扩缩容、滚动更新 |
| 服务网格 | 流量管理、服务发现、负载均衡 |
关键技术标签: Docker Kubernetes 容器化 模型服务化 负载均衡
5.3 监控运维与容量规划
| 技术方向 | 核心内容 |
|---|---|
| GPU 监控 | 利用率、显存、温度、功耗监控 |
| 推理指标 | TTFT、TPOT、Throughput、延迟监控 |
| 告警系统 | 阈值告警、异常检测、通知机制 |
| 容量规划 | 根据并发量和上下文长度估算 GPU 需求 |
| 高可用 | 多副本、故障转移、灾备方案 |
关键技术标签: 监控告警 容量规划 高可用 推理服务化
六、技术根基
NLP · CV · 数学 · 工程基础 — 底层技术能力支撑
6.1 NLP 基础
- 文本表示:词嵌入、句嵌入、文档嵌入
- 文本分类:TextCNN、TextRNN、TextRCNN、Text-GCN
- 信息检索:TF-IDF、BM25、向量检索、相关性排序
- 序列标注:NER、分词、词性标注
6.2 深度学习与 CV
- 经典网络:AlexNet、VGG、GoogLeNet、ResNet、NiN、FCN
- 优化器:SGD、Momentum、Adam、Muon
- 迁移学习:预训练模型微调、域适应
- 计算机视觉:图像分类、目标检测、图像处理
代表文章: ResNet 深度残差网络详解、神经网络优化器详解
6.3 数学与工程基础
- 数学:线性代数、概率论与数理统计、微积分、最优化
- 编程:Python、C++、MATLAB
- 工具:Git、Linux、Markdown、LaTeX
- 其他:密码学、计算机图形学
前沿模型跟踪
持续跟踪主流开源大模型的技术演进:
| 模型系列 | 代表型号 | 关注方向 |
|---|---|---|
| DeepSeek | V3/V4、R1 | MoE 架构、推理强化学习、稀疏注意力 |
| Qwen | Qwen3/3.5、Qwen3-VL、Qwen3.5-Omni | 全模态、长上下文、推理优化 |
| GLM | GLM-4.5V | 多模态、Agent 能力 |
| Gemma | Gemma-3/4 | 端侧模型、高效推理 |
| MiniCPM | MiniCPM-V、MiniCPM-o | 轻量级、全模态 |
| 其他 | Llama、Baichuan、InternLM、Phi、Ovis、Nex、MiniMax | 架构创新、训练技巧 |
代表文章:
学习路径建议
路径一:LLM 推理优化工程师
- 基础:Transformer 架构 → 注意力机制 → KV Cache
- 进阶:vLLM 源码 → PagedAttention → Continuous Batching
- 核心:量化压缩 → 投机解码 → 多卡分布式推理
- 实战:大模型部署 → 性能调优 → 推理服务化
路径二:Agent 工程师
- 基础:Prompt 工程 → Function Calling → ReAct
- 进阶:Agent 设计模式 → MCP 协议 → 记忆机制
- 核心:多 Agent 框架 → Workflow 编排 → 上下文工程
- 实战:单 Agent 应用 → 多 Agent 协作 → 企业级落地
路径三:AI 基础设施工程师
- 基础:Linux → Docker → Kubernetes
- 进阶:GPU 架构 → NCCL 通信 → 分布式训练
- 核心:模型服务化 → 监控告警 → 容量规划
- 实战:GPU 集群管理 → 推理平台搭建 → 高可用部署
本技术地图持续更新中。各方向的详细文章可通过 内容导航 按分类查阅,或通过 全部文章 按时间浏览。工程项目请查看 技术实践。