解读 GLM-5 相比 GLM-4.5 的关键改进:规模从 355B 扩展到 744B、专家数增加而层数减少以降低专家并行通信开销,以及为适配 Muon 优化器重新设计的 MLA 与 MuonSplit 注意力、中期训练与后训练配方。
GLM-5 技术报告摘要
论文:GLM-5: from Vibe Coding to Agentic Engineering
团队:Zhipu AI & Tsinghua University
时间:2026.02(arXiv:2602.15763)
页数:40页
1. 预训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 架构 | MoE, 744B总参/40B激活, 256experts, 80层 |
| 注意力 | MLA (Multi-Latent Attention) with MuonSplit adaptation |
| MTP | 有,参数共享设计 |
| 总Token | 28.5T |
| 阶段 | Pre-training + Mid-training(多阶段) |
| 上下文 | 最终200K |
关键架构改进(相比GLM-4.5)
① 规模扩展策略
- 从355B/32B(GLM-4.5) → 744B/40B(GLM-5)
- 从160experts/89layers → 256experts/80layers:减层数(减少EP通信开销),增expert数
② MLA + MuonSplit
- 问题:MLA在Muon优化器下性能不及GQA-8
- 做法:将MLA的up-projection矩阵(W_UQ, W_UK, W_UV)按head拆分为小矩阵,分别做matrix orthogonalization(原来是对整个大矩阵做)
- 效果:MLA性能匹配GQA-8;且注意力logits在训练中自然稳定,无需clipping
③ MLA-256head dimension
- 将head dimension从192提升到256,attention head数减少1/3
- 训练计算和参数量不变,但decoding计算降低(dot product 256-dim vs原576-dim latent)
Mid-training
| 阶段 | Token预算 | 序列长度 |
|---|---|---|
| Stage 1 | 1T | 32K |
| Stage 2 | 500B | 128K |
| Stage 3 | 50B | 200K |
数据重点:
- 软件工程:10M issue-PR pairs(放宽repo过滤+加强issue级过滤),含更多relevant files,~160B unique tokens
- 长上下文:natural(books/papers/docs) + synthetic(NextLong/EntropyLong启发,interleaved packing构建长距离依赖)
- 200K阶段额外引入MRCR-like data多种变体
训练数据
| 项目 | 详情 |
|---|---|
| Web | 沿用GLM-4.5 pipeline + 新增DCLM classifier做quality filtering |
| 过滤 | LLM打分,仅保留最educational内容;长文档用chunk-and-aggregate算法提升打分精度 |
| 严格排除 | 合成/AI生成/模板化数据 |
Infra设计
| 项目 | 详情 |
|---|---|
| Memory效率 | Flexible MTP placement:MTP层灵活分配到pipeline stages |
| 其他 | 原文提到interleaved pipeline parallelism,具体细节参考单独mHC paper |
2. 后训练 Recipe
SFT
| 项目 | 详情 |
|---|---|
| 数据 | 三大类:General Chat + Reasoning + Coding&Agent |
| Max context | 202,752 tokens |
| 关键创新 | 三种Thinking模式 |
三种Thinking模式:
| 模式 | 描述 |
|---|---|
| Interleaved Thinking | 每次response和tool call前都think,提升指令遵循和生成质量 |
| Preserved Thinking | coding agent场景中,跨多轮保留所有thinking blocks,复用已有推理不重新推导,适合长horizon复杂任务 |
| Turn-level Thinking | 支持每轮单独控制是否think,轻量请求关闭减少延迟/成本,复杂任务打开提升准确性 |
RL Pipeline(三阶段顺序)
| 阶段 | 内容 |
|---|---|
| ReasoningRL | 数学/代码/科学推理 |
| Agentic RL | 异步RL,长horizon agent任务 |
| General RL | human-style alignment |
| 最终 | On-Policy Cross-Stage Distillation |
3. RL Recipe
算法
| 项目 | 详情 |
|---|---|
| 基础算法 | Group-wise Policy Optimization (类GRPO) |
| AgentRL | 仅对model-generated tokens计算loss,忽略environment feedback tokens |
关键设计:Asynchronous RL for Agentic Tasks
问题:Agent rollout有严重长尾分布,同步RL大量GPU idle
做法:
- 训练引擎和推理引擎分离到不同GPU设备
- 推理引擎持续生成trajectories,累积到阈值后发送给训练引擎
- 每K次梯度更新后,训练引擎将新权重push回推理引擎
- 每次weight update后reset optimizer(因为优化问题已改变)
Server-based Multi-Task Rollout Orchestrator:
- 每个task实现独立rollout+reward微服务,注册到中央orchestrator
- orchestrator控制per-task rollout ratio和生成速度
- 所有agentic task的trajectories标准化为统一message-list表示
- 支持异构workload的joint training
关键设计:On-Policy Cross-Stage Distillation
- 问题:多阶段RL顺序优化不同目标会导致先前能力退化
- 做法:最终阶段用on-policy distillation快速恢复各阶段技能
- 前序阶段(SFT/ReasoningRL/GeneralRL)的final checkpoints作为teacher
- Advantage计算:Â{i,t} = sg[log(π_teacher(y{i,t}|…) / πtrain(y{i,t}|…))](用teacher与当前model的log概率差作advantage)
- group size设为1(不需要同prompt多sample来估计advantage),batch size=1024
Infra设计:Slime框架增强
| 项目 | 详情 |
|---|---|
| Scaling Out | 高度可定制rollout接口 + HTTP API暴露rollout server,外部agent框架可直接调用 |
| Scaling Up | ①No-queue serving: EP64+DP64多节点推理+DP-attention避免KV跨rank拷贝 ②FP8 rollout + MTP 降低per-token延迟 ③Prefill-Decode disaggregation |
| 鲁棒性 | Heartbeat-driven rollout fault tolerance + router-level server lifecycle management |
| 目标 | 最小化tail latency(而非throughput),因RL步骤受最慢sample制约 |
Agent RL 数据构造
| 任务类型 | 方法 |
|---|---|
| Software Engineering | LLM生成language-aware log-parsing函数提取F2P/P2P test cases,构建10K+可验证环境,跨9种语言 |
| Terminal Environments | ①从seed tasks用LLM生成Harbor格式任务(Docker化+test scripts),refine agent迭代优化,>90%构建准确率 ②从web corpus自动合成,closed-loop自验证 |
| Search Tasks | 报告提到有deep-search信息检索任务合成pipeline |
4. 关键亮点
- MuonSplit for MLA:按head拆分做矩阵正交化,解决MLA在Muon下性能差的问题
- 三种Thinking模式:Interleaved/Preserved/Turn-level,灵活控制推理粒度
- Fully Async Agentic RL:训练推理解耦+Server-based Multi-Task Orchestrator+weight periodic sync
- On-Policy Cross-Stage Distillation:用teacher log-prob差作advantage,group size=1高吞吐恢复各阶段能力
- 200K上下文:三阶段context extension (32K→128K→200K)
- Slime框架增强:HTTP API + PD disaggregation + FP8 + MTP,优化tail latency
- 10K+可验证coding环境:跨9语言,用LLM自动化构建+验证
- LM Arena #1 open model:Text Arena和Code Arena均为开源第一

