跳到正文
戈孔明

大模型工程实践者 · 推理优化与 Agent 落地


  • 首页

  • 归档

  • 导航

  • 技术地图

  • 技术实践

  • 关于

  • 搜索

推理框架分类

06-04

FastDeploy部署ERNIE-4.5实战:Docker镜像、环境依赖与推理服务搭建

06-04

Mooncake推理框架Qwen2.5-72B性能报告:预填充解码分离、RDMA/TCP后端与多QPS延迟实测

06-04

Mooncake推理框架环境搭建实战:系统依赖、编译安装与Qwen2.5-72B-Instruct部署

06-04

Ollama部署Qwen2-7B-Instruct实战:本地大模型工具、自定义GGUF文件运行与API调用

06-04

SGLang、vLLM与LMDeploy推理框架对比:架构特点、部署实践与性能差异分析

06-04

SGLang推理框架参数调优全解析:温度非确定性根源、动态批量处理与前缀缓存对输出一致性的影响

06-04

Transformers部署sqlcoder-70b-alpha实战:环境搭建、模型下载与文本到SQL推理测试

06-04

Transformers部署Qwen-14B-Chat实战:环境安装、OpenAI兼容API服务启动与Function Call测试

06-04

vLLM与SGLang部署DeepSeek-V3-0324系列:R1与V3模型定位、特点及适用场景对比

10-22

vLLM 0.11.0部署Qwen3-VL-2B-Instruct实战:Docker启动、OpenAI兼容API调用与返回参数解析

09-28

Qwen3-Embedding与Qwen3-Reranker模型解析:传统BERT<[bos_never_used_51bce0c785ca2f68081bfa7d91973934]>策略与新一代嵌入检索架构

09-25

Qwen2.5-VL图像Token数计算分析:patch步长、空间合并因子与动态分辨率下的视觉Token估算

12
戈孔明

戈孔明

戈孔明,大模型工程实践者。专注大模型推理优化、AI Agent、RAG 与企业级 AI 应用落地,沉淀 230+ 篇原创技术文章与工程实践笔记。

236 文章
36 分类
83 标签
GitHub E-Mail
近期文章
  • LM Studio部署Qwen3.8-27B实战(GB10):一键安装、GGUF模型加载与OpenAI兼容API服务
  • MiniCPM-O 4.5 CookBook概览:多模态模型配套文档与使用指南入口
  • Qwen3.6-27B与Qwen3.8-27B部署实战:vLLM Docker镜像、FP8量化与单卡推理
  • 主机DNS解析排查记录:网络连通性与域名解析故障定位(20260723)
  • H20部署DeepSeek-V4-Flash-0731实战:FP8 KV Cache、DSpark投机解码与专家并行调优
热门标签
  • 模型部署
  • Qwen
  • vLLM
  • MoE
  • 注意力机制
  • 多模态
  • GPU
  • DeepSeek
  • 强化学习
  • 智能体
  • 推理框架
  • 预训练
  • 推理优化
  • 论文解读
  • 分布式训练
  • 量化
  • 长上下文
  • KV Cache
  • 大模型
  • 位置编码
© 2020 — 2026 戈孔明 | 658.3k 赣ICP备20004005号
0%