

DeepSeek-V4(2026.04.24)
DeepSeek-V4-Pro 是 DeepSeek-V4 系列中的旗舰 MoE 语言模型,拥有 1.6T 总参数、49B 激活参数,原生支持 100 万 tokens 的超长上下文。该模型采用创新的混合注意力架构,结合压缩稀疏注意力(CSA)与高度压缩注意力(HCA),在 1M 上下文下仅需 DeepSeek-V3.2 的 27% 单 token 推理 FLOPs 和 10% KV 缓存。模型还引入流形约束超连接(mHC)增强层间信号传播稳定性,并采用 Muon 优化器加速收敛。

DeepSeek-V4-Pro 在超过 32T 高质量多样化 tokens 上预训练,后训练采用“领域专家独立培养 + 在线策略蒸馏统一整合”的两阶段范式。其最大推理强度模式 DeepSeek-V4-Pro-Max 在编程基准上取得顶尖表现,并在推理与 Agentic 任务上大幅缩小与领先闭源模型的差距,是目前最强的开源模型之一,支持 Non-think、Think High、Think Max 三种推理强度模式。
vllm命令调用
1 | export VLLM_MEMORY_PROFILER_ESTIMATE_CUDAGRAPHS=0 |
GLM-5.1(2026.04.08)
GLM-5.1 是面向智能体工程的下一代旗舰模型,采用混合专家(MoE)架构,拥有 754B 参数。该模型编程能力显著增强,在 SWE-Bench Pro 上取得了领先水平,在 NL2Repo(仓库生成)和 Terminal-Bench 2.0(真实终端任务)等基准上大幅领先前代。

GLM-5.1 专为长周期智能体任务设计,能够以更好的判断力处理模糊问题,拆解复杂任务、执行实验、分析结果,并在数百轮迭代和数千次工具调用中持续优化。
vllm命令调用
1 | vllm serve zai-org/GLM-5.1-FP8 \ |
Kimi 2.6(2026.04.21)
Kimi K2.6 是月之暗面(Moonshot AI)开源的原生多模态智能体模型,在 HLE(含工具)、SWE-Bench Pro、BrowseComp 等多项主流榜单上取得开源最优水平。 模型采用 MoE 架构,总参数量 1T,激活参数 32B,支持 256K tokens 上下文,并通过 MoonViT 视觉编码器支持图像与视频输入。

K2.6 专为智能体场景优化:支持 4,000+ 次工具调用与超 12 小时持续自主执行;多智能体协作可扩展至 300 个并行子智能体 × 4,000 步,单次运行生成 100+ 文件;同时支持思考(Thinking)与即时(Instant)双推理模式,以及 Function Call 与多轮思维链保留能力。
vllm命令调用
1 | vllm serve moonshotai/Kimi-K2.6 \ |
Qwen3.5-122B(2026.02.26)
Qwen3.5-122B-A10B 是通义千问团队推出的原生多模态大语言模型,总参数量 122B,激活参数量仅 10B。该模型采用门控 Delta 网络与稀疏混合专家(MoE)相结合的高效混合架构,原生支持 256K 上下文长度,并可扩展至约 100 万 tokens。

模型通过早期融合训练实现了统一的视觉语言基础能力,支持文本、图像和视频理解,在知识、推理、编程、智能体、视觉理解和多语言等多项基准测试中表现优异,并在多项指标上超越 GPT-5-mini 和 Qwen3-235B-A22B。模型默认启用思考模式(Thinking Mode),支持工具调用,并覆盖 201 种语言和方言。
vllm命令调用
1 | vllm serve Qwen/Qwen3.5-122B-A10B \ |
Qwen3.6-27B(2026.04.23)
Qwen3.6-27B 是 Qwen3.6 系列首个开源的中小尺寸稠密模型,针对代码生成、Agent 工作流与真实开发场景进行了重点增强。相比 Qwen3.5-27B,该模型在前端开发、仓库级推理、工具调用与复杂问题求解等任务上均有明显提升,并新增历史推理上下文保留能力,可减少多轮交互中的重复推理,提升稳定性与执行效率。模型同时支持视觉理解,原生上下文长度为 262,144 tokens。
vllm命令调用
1 | vllm serve Qwen/Qwen3.6-27B \ |
MiMo-V2.5-Pro(2026.04.27)
MiMo-V2.5-Pro 是小米于2026年4月推出的旗舰级AI大模型,专为高强度智能体(Agent)工作、复杂软件工程和长程复杂任务打造。原生全模态支持,采用混合专家架构(MoE),总参数量达 1.02T,激活参数为 42B,具备 1M 超长上下文窗口。
MiniMax-M2.7(2026.03.18)
MiniMax-M2.7 是 MiniMax 推出的最新大语言模型,通过在数十万个复杂真实环境中进行大规模强化学习训练。该模型采用 MoE 架构,拥有 2290 亿参数,在编程、智能体工具调用与搜索、办公场景等任务中达到业界领先水平。

