跳到正文
孔明の博客

AI 大模型研发与应用


  • Home

  • Archives

  • Search

vLLMTag

07-23

vLLM 推理框架部署 Qwen3-235B-A22B 大语言模型实践

06-08

DeepSeek-V4 高效长上下文注意力:FP4 混合精度与稀疏注意力解析

10-27

dots.ocr 模型部署实战:基于 vLLM 的推理服务与解析流程

10-27

PaddleOCR-VL 模型部署实战:Docker 镜像与 vLLM 服务启动

10-27

MinerU2.5 模型部署实战:vLLM 镜像与解析服务搭建

10-27

DeepSeek-OCR 模型部署实战:Docker 镜像与 vLLM 推理服务

11-22

LLM 推理框架运行时优化:CUDA Graph、分块预填充与投机解码

06-03

AWQ 激活感知权重量化详解:4-Bit 量化与 vLLM 部署

06-03

GPTQ 量化详解:基于近似二阶信息的一次性权重量化

06-01

七大 LLM 推理服务框架横向对比与选型

04-24

vLLM 源码解析(一):SequenceGroup 与调度执行链路

04-23

vLLM 架构解析:离线批处理、在线服务与 LLMEngine 内核

12
戈孔明

戈孔明

185 posts
50 categories
736 tags
GitHub E-Mail
我的平台
  • 个人博客
  • 知识库
© 2020 — 2026 戈孔明 | 531.6k 赣ICP备20004005号
0%