技术实践

技术实践

这里整理了我在大模型工程化方向的技术探索与工程实践,按领域归类,并关联对应的深度技术文章。所有内容均来自实际动手验证与源码级梳理。


一、大模型推理与部署优化

实践方向:超大模型分布式推理部署、推理性能调优、推理服务化

围绕 vLLM、SGLang 等主流推理框架,深入梳理从模型加载到高吞吐服务的全链路技术,包括 PagedAttention 显存管理、Continuous Batching 批量调度、KV Cache 优化、量化压缩、多卡张量并行与流水线并行等核心机制。

技术栈:vLLM、SGLang、Tensor Parallel、Pipeline Parallel、PagedAttention、KV Cache、量化、Continuous Batching

实践产出

  • 235B MoE 模型的多卡分布式推理部署方案梳理
  • 推理性能调优方法论:显存优化、批量调度、投机解码
  • 推理服务监控指标与容量规划要点

相关文章(20 篇)


二、AI Agent 与工作流设计

实践方向:Agent 架构设计、多 Agent 协作、工具调用与工作流编排

系统梳理 Agent 设计模式与主流框架,从 ReAct、Plan-and-Execute 到 Agentic RAG,深入分析 MCP 协议的上下文接入机制,以及多 Agent 协作框架的选型与工程实现要点。

技术栈:Agent Framework、MCP 协议、Workflow Engine、Multi-Agent、Function Calling、ReAct

实践产出

  • Agent 设计模式系列:从单 Agent 到多 Agent 的架构演进
  • MCP 协议接入统一上下文与工具生态的方案设计
  • 主流多 Agent 框架横向对比与选型建议

相关文章(9 篇)


三、检索增强(RAG)与知识库

实践方向:企业文档检索增强、向量检索优化、文档解析流水线

围绕 RAG 系统的全链路技术,从文档解析、分块策略、向量检索到重排序与答案溯源,系统梳理各环节的优化方法。包括混合检索、查询改写、Rerank 精排等提升检索质量的核心技术。

技术栈:RAG、Embedding、Vector Database、Rerank、混合检索、文档解析、Chunking Strategy

实践产出

  • 多格式文档解析流水线设计:PDF、Word、PPT、表格、图片
  • 检索策略优化方案:混合检索、重排序、查询改写
  • 知识库治理要点:分块策略、元数据管理、权限控制

相关文章(14 篇)


四、文档理解与多模态 OCR

实践方向:文档解析专用模型部署、复杂版面结构化提取、多模态文档理解

基于 vLLM 部署文档理解专用模型(dots.ocr、PaddleOCR-VL 等),梳理复杂版面(表格、公式、图表)的结构化提取流程,并对主流文档解析模型进行横向对比与选型分析。

技术栈:Document AI、OCR、Layout Analysis、vLLM、多模态模型、结构化输出、表格识别

实践产出

  • 主流文档解析专用模型横评与选型建议
  • 基于 vLLM 的 OCR 模型推理服务化方案
  • 复杂版面结构化提取流程:表格、公式、图表

相关文章(11 篇)


五、大模型架构与技术体系

实践方向:前沿模型技术报告解读、大模型架构演进、训练与对齐技术

持续跟踪 DeepSeek、Qwen、Kimi、Seed 等前沿模型的技术演进,从架构设计、训练配方到对齐策略进行源码级梳理,形成覆盖大模型全栈的知识体系。

技术栈:Transformer、MoE、注意力机制、多模态、长上下文、预训练、RLHF、分布式训练

实践产出

  • 大模型全栈知识体系:架构、训练、推理、Agent、RAG
  • 前沿模型技术报告深度解读系列
  • 开源大模型技术演进时间线梳理

相关文章(78 篇)


以上各方向的技术文章均可通过 内容导航 按主题查阅,或通过 全部文章 按时间浏览。欢迎通过 关于我 中的联系方式交流技术问题。