大模型推理优化·AI Agent 工程化·企业级 AI 落地
这里沉淀大模型全栈工程实践,覆盖模型架构解读、推理性能调优、Agent 工作流设计、RAG 知识库构建与企业级 AI 应用落地。
6年+AI 工程经验
推理大模型性能优化
Agent工程化落地
企业级AI 应用构建
大模型 推理优化 AI Agent RAG AI Infra 文档理解
技术领域
大模型架构
Transformer MoE 注意力机制 多模态 长上下文 训练对齐
推理与部署
vLLM SGLang KV Cache 量化压缩 分布式推理 性能调优
Agent 与应用
Agent 设计 Workflow MCP 协议 RAG 检索 文档理解 OCR
AI 基础设施
GPU 集群 Docker Kubernetes 模型服务化 监控告警 容量规划
我能做什么
大模型推理优化
从模型加载、多卡 TP/PP 并行、KV Cache 管理到高并发推理服务搭建,关注吞吐、延迟与 GPU 利用率的平衡,覆盖 vLLM、SGLang 等主流推理框架的部署与调优。
vLLM / SGLang 多卡 TP/PP KV Cache FP8/FP4 量化 高并发调优 长上下文
Agent 工程化
从单 Agent 设计、Workflow 编排到 Multi-Agent 协作,关注工具调用、上下文工程、记忆机制与 Agent 编排,推动 Agent 从 Demo 走向企业业务落地。
Agent 设计模式 Workflow 编排 MCP 协议 Multi-Agent 工具调用 上下文工程
企业级 AI 应用
RAG 知识库构建、文档智能解析、OCR 与多模态理解,以及 AI Platform / AI PaaS 的架构设计,将大模型能力封装为可复用的企业级服务与智能体应用。
RAG 知识库 文档智能 OCR / 多模态 AI PaaS 智能体应用 故障诊断
AI 基础设施
GPU 集群管理、Docker 容器化、Kubernetes 编排与模型服务化,覆盖从模型部署、监控告警到容量规划的全链路 AI Infra 工程实践,保障大模型服务的稳定与高效。
GPU 集群 Docker Kubernetes 模型服务化 监控告警 容量规划
代表工程
我做过的真实工程项目,从架构设计到性能优化
大模型推理部署优化
基于 vLLM 部署 235B MoE 大模型,多卡 TP/EP 并行,FP8 量化,KV Cache 优化,高并发推理服务化。
vLLM 235B MoE FP8 多卡并行
查看详情
AI Agent 与工作流
从单 Agent 到 Multi-Agent 协作,MCP 协议统一工具接入,Workflow 编排,企业级智能体应用落地。
Multi-Agent MCP Workflow ReAct
查看详情
企业级 RAG 与文档智能
RAG 知识库构建,混合检索 + Rerank 精排,多模态文档理解(OCR/表格/公式),AI PaaS 平台架构设计。
RAG Document AI OCR AI PaaS
查看详情