跳到正文
戈孔明
大模型工程实践者 · 推理优化与 Agent 落地
首页
归档
导航
技术地图
技术实践
关于
搜索
输入搜索关键词
模型部署
分类
08-28
LM Studio部署Qwen3.8-27B实战(GB10):一键安装、GGUF模型加载与OpenAI兼容API服务
08-25
Qwen3.6-27B与Qwen3.8-27B部署实战:vLLM Docker镜像、FP8量化与单卡推理
08-10
H20部署DeepSeek-V4-Flash-0731实战:FP8 KV Cache、DSpark投机解码与专家并行调优
07-30
PaddleOCR-VL部署遗留问题排查:容器报错、API文档与vLLM部署配置参考
07-15
H20部署GLM5.2-FP8实战:SGLang Docker命令与投机解码参数配置
06-18
NvLink多卡互联配置实战:GPU集群组网与带宽调优记录
06-16
A100八卡部署Qwen3.5-122B-A10B实战:Docker与裸机vLLM启动、FP8优化与Benchmark
06-15
H20集群模型切换演进记录:从单台到跨机部署DeepSeek-V4与GLM5.1的时间线
05-28
AIGC私有化大模型部署资源规划表:硬件、显存与存储资源清单
07-07
H20部署实战:DeepSeek-V4-Flash与GLM-5.1-FP8双模型推理配置
0
%