大模型推理优化·AI Agent 工程化·企业级 AI 落地
这里沉淀大模型全栈工程实践,覆盖模型架构解读、推理性能调优、Agent 工作流设计、RAG 知识库构建与企业级 AI 应用落地。
6年+AI 工程经验
推理大模型性能优化
Agent工程化落地
企业级AI 应用构建
推理优化 AI Agent 大模型 RAG AI Infra 文档理解
技术能力
四大核心方向,从模型架构到企业级落地
大模型架构与训练
模型架构解读、预训练与对齐技术,覆盖 Transformer 与 MoE 等主流体系。
Transformer MoE 注意力机制 长上下文 预训练对齐 多模态
推理与部署
vLLM / SGLang 推理框架部署调优,KV Cache 优化、量化与高并发服务化。
vLLM SGLang KV Cache 量化压缩 并行推理 服务化调优
Agent 工程化
从单 Agent 到 Multi-Agent 协作,MCP 协议统一工具接入与 Workflow 编排。
Agent 设计模式 MCP 协议 Workflow Multi-Agent 工具调用 RAG 检索
企业级 AI 落地
RAG 知识库与文档智能,AI PaaS 平台架构,GPU 集群与容器化运维。
RAG 知识库 文档智能 OCR 多模态 AI PaaS Docker Kubernetes
代表工程
我做过的真实工程项目,从架构设计到性能优化
大模型推理部署优化
基于 vLLM 部署 235B MoE 大模型,多卡 TP/EP 并行,FP8 量化,KV Cache 优化,高并发推理服务化。
vLLM 235B MoE FP8 多卡并行
查看详情
AI Agent 与工作流
从单 Agent 到 Multi-Agent 协作,MCP 协议统一工具接入,Workflow 编排,企业级智能体应用落地。
Multi-Agent MCP Workflow ReAct
查看详情
企业级 RAG 与文档智能
RAG 知识库构建,混合检索 + Rerank 精排,多模态文档理解(OCR/表格/公式),AI PaaS 平台架构设计。
RAG Document AI OCR AI PaaS
查看详情