跳到正文
戈孔明

大模型工程实践者 · 推理优化与 Agent 落地


  • 首页

  • 归档

  • 导航

  • 技术地图

  • 技术实践

  • 关于

  • 搜索

模型认知与生态分类

08-25

MiniCPM-O 4.5 CookBook概览:多模态模型配套文档与使用指南入口

07-14

主流开源大模型上下文长度对照表:Qwen、DeepSeek-V4、GLM5.2与MiniMax-M3等私有模型参数梳理

06-18

2026年6月大模型发布全景汇总:80+条开源与商业模型动态梳理

06-16

大语言模型基准测试全解:GLUE/HumanEval/MT-Bench等评测方法与主流公开榜单对比

06-15

大语言模型排行榜快照(2026年6月):Arena AI全模型与开源模型榜单

06-13

DeepSeek系列模型推理性能对比:V4-Pro与V4-Flash资源效率及多版本横向比较

06-04

vLLM v0.10.2更新日志解读:新增模型家族、V1引擎成熟化、Blackwell优化与PyTorch 2.8升级

06-04

2080Ti安装vLLM完整教程:CUDA/PyTorch/Anaconda环境搭建、Qwen1.5-14B部署与常见报错排查

06-04

vLLM官方Benchmark工具使用指南:延迟、前缀缓存、服务端与吞吐量四类压测脚本实战

06-04

最新开源大模型简介(第38周):Qwen3-Max、GLM-5.2等模型发布动态与能力亮点

05-29

2026年5月主流开源大模型横向对比:DeepSeek-V4、GLM-5.1、Kimi K2.6与Qwen3.5架构能力及vLLM部署

05-27

2026年3月前沿开源模型调研:开源模型最新进展与部署资源情况汇总

12
戈孔明

戈孔明

戈孔明,大模型工程实践者。专注大模型推理优化、AI Agent、RAG 与企业级 AI 应用落地,沉淀 180+ 篇原创技术文章与工程实践笔记。

236 文章
36 分类
83 标签
GitHub E-Mail
近期文章
  • LM Studio部署Qwen3.8-27B实战(GB10):一键安装、GGUF模型加载与OpenAI兼容API服务
  • MiniCPM-O 4.5 CookBook概览:多模态模型配套文档与使用指南入口
  • Qwen3.6-27B与Qwen3.8-27B部署实战:vLLM Docker镜像、FP8量化与单卡推理
  • 主机DNS解析排查记录:网络连通性与域名解析故障定位(20260723)
  • H20部署DeepSeek-V4-Flash-0731实战:FP8 KV Cache、DSpark投机解码与专家并行调优
热门标签
  • 模型部署
  • Qwen
  • vLLM
  • MoE
  • 注意力机制
  • 多模态
  • GPU
  • DeepSeek
  • 强化学习
  • 智能体
  • 推理框架
  • 预训练
  • 推理优化
  • 论文解读
  • 分布式训练
  • 量化
  • 长上下文
  • KV Cache
  • 大模型
  • 位置编码
© 2020 — 2026 戈孔明 | 658.2k 赣ICP备20004005号
0%