2026年5月主流开源大模型横向对比:DeepSeek-V4、GLM-5.1、Kimi K2.6与Qwen3.5架构能力及vLLM部署

Artificial Analysis 开源模型排行榜

Arena AI 排行榜

DeepSeek-V4(2026.04.24)

DeepSeek-V4-Pro 是 DeepSeek-V4 系列中的旗舰 MoE 语言模型,拥有 1.6T 总参数、49B 激活参数,原生支持 100 万 tokens 的超长上下文。该模型采用创新的混合注意力架构,结合压缩稀疏注意力(CSA)与高度压缩注意力(HCA),在 1M 上下文下仅需 DeepSeek-V3.2 的 27% 单 token 推理 FLOPs 和 10% KV 缓存。模型还引入流形约束超连接(mHC)增强层间信号传播稳定性,并采用 Muon 优化器加速收敛。

DeepSeek 模型细节

DeepSeek-V4-Pro 在超过 32T 高质量多样化 tokens 上预训练,后训练采用“领域专家独立培养 + 在线策略蒸馏统一整合”的两阶段范式。其最大推理强度模式 DeepSeek-V4-Pro-Max 在编程基准上取得顶尖表现,并在推理与 Agentic 任务上大幅缩小与领先闭源模型的差距,是目前最强的开源模型之一,支持 Non-think、Think High、Think Max 三种推理强度模式。

vllm命令调用

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
export VLLM_MEMORY_PROFILER_ESTIMATE_CUDAGRAPHS=0

vllm serve deepseek-ai/DeepSeek-V4-Pro \
--trust-remote-code \
--kv-cache-dtype fp8 \
--block-size 256 \
--enable-expert-parallel \
--tensor-parallel-size 8 \
--gpu-memory-utilization 0.95 \
--compilation-config '{"mode": 0, "cudagraph_mode": "FULL_DECODE_ONLY"}' \
--max-num-batched-tokens 8192 \
--max-num-seqs 256 \
--max-model-len auto \
--no-enable-flashinfer-autotune \
--enable-ep-weight-filter \
--tokenizer-mode deepseek_v4 \
--tool-call-parser deepseek_v4 \
--enable-auto-tool-choice \
--reasoning-parser deepseek_v4 \
--speculative_config '{"method":"mtp","num_speculative_tokens":2}'

GLM-5.1(2026.04.08)

GLM-5.1 是面向智能体工程的下一代旗舰模型,采用混合专家(MoE)架构,拥有 754B 参数。该模型编程能力显著增强,在 SWE-Bench Pro 上取得了领先水平,在 NL2Repo(仓库生成)和 Terminal-Bench 2.0(真实终端任务)等基准上大幅领先前代。

GLM5.1 模型细节

GLM-5.1 专为长周期智能体任务设计,能够以更好的判断力处理模糊问题,拆解复杂任务、执行实验、分析结果,并在数百轮迭代和数千次工具调用中持续优化。

vllm命令调用

1
2
3
4
5
6
7
8
9
10
11
12
13
vllm serve zai-org/GLM-5.1-FP8 \
--trust-remote-code \
--chat-template-content-format=string \
--tensor-parallel-size 8 \
--max-num-batched-tokens 8192 \
--gpu-memory-utilization 0.95 \
--max-num-seqs 256 \
--max-model-len auto \
--tool-call-parser glm47 \
--enable-auto-tool-choice \
--reasoning-parser glm45 \
--speculative-config.method mtp \
--speculative-config.num_speculative_tokens 3

Kimi 2.6(2026.04.21)

Kimi K2.6 是月之暗面(Moonshot AI)开源的原生多模态智能体模型,在 HLE(含工具)、SWE-Bench Pro、BrowseComp 等多项主流榜单上取得开源最优水平。 模型采用 MoE 架构,总参数量 1T,激活参数 32B,支持 256K tokens 上下文,并通过 MoonViT 视觉编码器支持图像与视频输入。

Kimi 2.6 模型细节

K2.6 专为智能体场景优化:支持 4,000+ 次工具调用与超 12 小时持续自主执行;多智能体协作可扩展至 300 个并行子智能体 × 4,000 步,单次运行生成 100+ 文件;同时支持思考(Thinking)与即时(Instant)双推理模式,以及 Function Call 与多轮思维链保留能力。

vllm命令调用

1
2
3
4
5
6
7
8
9
10
11
12
13
vllm serve moonshotai/Kimi-K2.6 \
--trust-remote-code \
--tensor-parallel-size 8 \
--max-num-batched-tokens 8192 \
--gpu-memory-utilization 0.95 \
--decode-context-parallel-size 8 \
--max-model-len auto \
--max-num-seqs 256 \
--tool-call-parser kimi_k2 \
--enable-auto-tool-choice \
--reasoning-parser kimi_k2 \
--speculative-config '{"model":"lightseekorg/kimi-k2.6-eagle3-mla","method":"eagle3","num_speculative_tokens":3}' \
--mm-encoder-tp-mode data

Qwen3.5-122B(2026.02.26)

Qwen3.5-122B-A10B 是通义千问团队推出的原生多模态大语言模型,总参数量 122B,激活参数量仅 10B。该模型采用门控 Delta 网络与稀疏混合专家(MoE)相结合的高效混合架构,原生支持 256K 上下文长度,并可扩展至约 100 万 tokens。

Qwen3.5-122B

模型通过早期融合训练实现了统一的视觉语言基础能力,支持文本、图像和视频理解,在知识、推理、编程、智能体、视觉理解和多语言等多项基准测试中表现优异,并在多项指标上超越 GPT-5-mini 和 Qwen3-235B-A22B。模型默认启用思考模式(Thinking Mode),支持工具调用,并覆盖 201 种语言和方言。

vllm命令调用

1
2
3
4
5
6
7
8
9
10
11
vllm serve Qwen/Qwen3.5-122B-A10B \
--trust-remote-code \
--tensor-parallel-size 8 \
--max-num-batched-tokens 8192 \
--gpu-memory-utilization 0.95 \
--max-num-seqs 256 \
--max-model-len auto \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--mm-encoder-tp-mode data

Qwen3.6-27B(2026.04.23)

Qwen3.6-27B 是 Qwen3.6 系列首个开源的中小尺寸稠密模型,针对代码生成、Agent 工作流与真实开发场景进行了重点增强。相比 Qwen3.5-27B,该模型在前端开发、仓库级推理、工具调用与复杂问题求解等任务上均有明显提升,并新增历史推理上下文保留能力,可减少多轮交互中的重复推理,提升稳定性与执行效率。模型同时支持视觉理解,原生上下文长度为 262,144 tokens。

vllm命令调用

1
2
3
4
5
6
7
8
9
10
11
vllm serve Qwen/Qwen3.6-27B \
--trust-remote-code \
--tensor-parallel-size 1 \
--max-num-seqs 256 \
--max-num-batched-tokens 8192 \
--gpu-memory-utilization 0.95 \
--max-model-len auto \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--mm-encoder-tp-mode data

MiMo-V2.5-Pro(2026.04.27)

MiMo-V2.5-Pro 是小米于2026年4月推出的旗舰级AI大模型,专为高强度智能体(Agent)工作、复杂软件工程和长程复杂任务打造。原生全模态支持,采用混合专家架构(MoE),总参数量达 1.02T,激活参数为 42B,具备 1M 超长上下文窗口。

MiniMax-M2.7(2026.03.18)

MiniMax-M2.7 是 MiniMax 推出的最新大语言模型,通过在数十万个复杂真实环境中进行大规模强化学习训练。该模型采用 MoE 架构,拥有 2290 亿参数,在编程、智能体工具调用与搜索、办公场景等任务中达到业界领先水平。

本文结束 感谢您的阅读