vLLM v0.10.2更新日志解读:新增模型家族、V1引擎成熟化、Blackwell优化与PyTorch 2.8升级

内容来源:https://github.com/vllm-project/vllm/releases/tag/v0.10.2

模型支持

  • 新增模型家族及增强:支持Apertus (#23068)、LFM2 (#22845)、MiDashengLM (#23652)、Motif-1-Tiny (#23414)、Seed-Oss (#23241)、Google EmbeddingGemma-300m (#24318)、GTE序列分类 (#23524)、Donut OCR模型 (#23229)、KeyeVL-1.5-8B (#23838)、R-4B视觉模型 (#23246)、Ernie4.5 VL (#22514)、MiniCPM-V 4.5 (#23586)、Ovis2.5 (#23084)、带混合注意力的Qwen3-Next (#24526)、支持视频的InternVL3.5 (#23658)、Qwen2Audio嵌入 (#23625)、NemotronH Nano VLM (#23644)、BLOOM V1引擎 (#23488)、Whisper编码器-解码器(V1) (#21088)。
  • 流水线并行(PP)扩展:新增Hunyuan (#24212)、Ovis2.5 (#23405)、GPT-OSS (#23680)、Kimi-VL-A3B-Thinking-2506 (#23114)的PP支持。
  • 视觉模型数据并行(DP):为Qwen2.5VL (#22742)、MiniCPM-V (#23948, #23327)、Kimi-VL (#23817)、GLM-4.5V (#23168)的ViT模型启用DP。
  • LoRA生态扩展:新增Voxtral (#24517)、Qwen-2.5-Omni (#24231)、DeepSeek V2/V3/R1-0528 (#23971)的LoRA支持,LoRA启动性能显著提升 (#23777)。
  • 分类与池化增强:支持多标签分类 (#23173)、logit偏移与sigmoid归一化 (#24031)、池化模型的FP32精度头 (#23810)。
  • 性能优化:移除GLM-4.1V (#24332)和Qwen2VL (#24334)预处理中不必要的CUDA同步;消除Qwen3 MoE中的冗余all-reduce (#23169);优化InternVL CPU线程 (#24519)和GLM4.5-V视频帧解码 (#24161)。

引擎核心

  • V1引擎成熟化:将V1支持扩展到计算能力<8.0的设备 (#23614, #24022);为编码器-解码器模型添加交叉注意力KV缓存 (#23664);集成请求级logits处理器 (#23656);支持从连接器获取KV事件 (#19737)。
  • 后端扩展:集成Terratorch后端 (#23513),支持语义分割、地理空间应用等非语言模型任务(通过-model-impl terratorch)。
  • 混合与Mamba模型改进:默认启用混合模型的全CUDA图 (#22594);为混合/Mamba模型禁用前缀缓存 (#23716);添加FP32 SSM核支持 (#23506);为Mamba1提供全CUDA图支持 (#23035);Mamba模型默认使用V1引擎 (#23650)。
  • 性能核心优化-safetensors-load-strategy加速NFS文件加载 (#24469);修复CUDA图捕获吞吐量的关键问题 (#24128);优化单条生成的调度器 (#21917);多线程模型权重加载 (#23928);强制FlashInfer解码使用张量核 (#23214)。
  • 多模态增强:用mm_hash跟踪多模态缓存 (#22711);基于UUID的多模态标识符 (#23394);改进V1视频嵌入估计 (#24312);简化多模态UUID处理 (#24271)。
  • 采样与结构化输出:支持全prompt logprobs (#23868);支持最终logprobs (#22387);优化语法位掩码 (#23361);支持用户配置KV缓存内存大小 (#21489)。
  • 分布式:为MLA支持解码上下文并行(DCP) (#23734)。

硬件与性能

  • NVIDIA Blackwell/SM100系列:支持CUTLASS后端的FP8 MLA (#23289);DeepGEMM线性层(端到端吞吐量提升1.5%) (#23351);为DeepSeekV3.1提供Hopper DeepGEMM E8M0 (#23666);SM100 FlashInfer CUTLASS MoE FP8后端 (#22357);MXFP4融合CUTLASS MoE (#23696);Blackwell默认使用MXFP4 MoE (#23008);GPT-OSS DP/EP支持(吞吐量52,003 tokens/秒) (#23608)。
  • 重大变更:因兼容性问题,Blackwell GPU上禁用FlashMLA (#24521)。
  • 核与注意力优化:支持CUDA图的FlashAttention MLA (#14258, #23958);V1交叉注意力支持 (#23297);FP8 FlashMLA支持 (#22668);MoE的融合分组TopK (#23274);Flash线性注意力核 (#24518);Hopper的W4A8支持 (#23198)。
  • 性能提升:token转换速度提升13.7倍 (#20413);分布式服务的TTIT/TTFT改进 (#22760);默认启用对称内存all-reduce (#24111);启动时预热FlashInfer (#23439);V1模型执行重叠 (#23569);Triton配置调优 (#23748, #23939)。
  • 平台扩展:Apple Silicon M2+的bfloat16支持 (#24129);IBM Z的V1引擎支持 (#22725);Intel XPU的torch.compile (#22609);XPU MoE数据并行 (#22887);XPU Triton注意力 (#24149);XPU FP8量化 (#23148);ROCm Ray流水线并行 (#24275)。
  • 模型特定优化:为B200/H200/H100上的Qwen3-Next优化MoE配置 (#24698, #24688, #24699, #24695);GLM-4.5-Air-FP8 B200配置 (#23695);Kimi K2优化 (#24597);QWEN3 Coder/Thinking配置 (#24266, #24330)。

量化

  • 新增量化功能:逐层量化路由 (#23556);支持跳过层的GGUF量化 (#23188);NFP4+FP8 MoE支持 (#22674);W4A8通道缩放 (#23570);AMD CDNA2/CDNA3 FP4支持 (#22527)。
  • 高级量化基础设施:为线性操作提供压缩张量转换 (#22486),支持SpinQuantR1R2R4、QuIP等量化方法。
  • FlashInfer量化集成:TRTLLM预填充注意力的FP8 KV缓存 (#24197);FP8-qkv注意力核 (#23647);FP8逐张量GEMM (#22895)。
  • 平台特定量化:ROCm TorchAO量化启用 (#24400);TorchAO模块替换配置 (#21982)。
  • 性能优化:MXFP4 MoE加载缓存优化 (#24154);压缩张量版本更新 (#23202)。
  • 重大变更:移除原始Marlin量化格式 (#23204)。

API与前端

  • OpenAI API增强:Gemma3n音频转录/翻译端点 (#23735);转录响应的使用统计 (#23576);return_token_ids参数 (#22587)。
  • 响应API改进:非harmony响应的流式支持 (#23741);非流式logprobs (#23319);MCP工具后台模式 (#23494);MCP流式+后台支持 (#23927);工具输出token报告 (#24285)。
  • 前端优化-log-error-stack显示错误堆栈 (#22960);集体RPC端点 (#23075);束搜索并发优化 (#23599);跳过不必要的detokenization (#24236);自定义媒体UUID (#23449)。
  • 配置增强:规范化-mm-encoder-tp-mode参数 (#23190);VLLM_DISABLE_PAD_FOR_CUDAGRAPH环境变量 (#23595);EPLB配置参数 (#20562);嵌入端点的聊天请求支持 (#23931);LM Format Enforcer V1集成 (#22564)。

依赖项

  • 主要更新:PyTorch 2.8.0升级(重大变更,需更新环境) (#20358);FlashInfer v0.3.0升级 (#24086);FlashInfer 0.2.14.post1维护更新 (#23537)。
  • 支持性更新:XGrammar 0.1.23 (#22988);tpu_info 0.4.0修复TPU核心转储 (#23135);压缩张量版本更新 (#23202)。
  • 部署改进FlashInfer cubin目录环境变量(支持离线环境预缓存CUDA二进制) (#22675)。

V0功能弃用

  • 后端移除:弃用V0 Neuron后端 (#21159);移除V0池化模型支持 (#23434);移除V0 FlashInfer注意力后端 (#22776);清理V0测试 (#23418, #23862)。
  • API重大变更:移除LLM.generateLLM.embed中的prompt_token_ids回退 (#18800);LoRA额外 vocab大小的弃用警告 (#23635);LoRAbias参数弃用 (#24339);指标名称从TPOT改为ITL (#24110)。

重大变更汇总

  1. PyTorch 2.8.0升级——环境依赖变更,需更新CUDA版本
  2. FlashMLA Blackwell限制——因兼容性问题,Blackwell GPU上禁用FlashMLA
  3. V0功能移除——Neuron后端、池化模型、FlashInfer注意力后端
  4. 量化变更——移除量化Mixtral的hack实现及原始Marlin格式
  5. 指标重命名——TPOT弃用,改用ITL
本文结束 感谢您的阅读