GLM-5 技术报告解读:从 Vibe Coding 到智能体工程

解读 GLM-5 相比 GLM-4.5 的关键改进:规模从 355B 扩展到 744B、专家数增加而层数减少以降低专家并行通信开销,以及为适配 Muon 优化器重新设计的 MLA 与 MuonSplit 注意力、中期训练与后训练配方。

GLM-5 技术报告摘要

论文:GLM-5: from Vibe Coding to Agentic Engineering
团队:Zhipu AI & Tsinghua University
时间:2026.02(arXiv:2602.15763)
页数:40页


1. 预训练 Recipe

训练策略

项目详情
架构MoE, 744B总参/40B激活, 256experts, 80层
注意力MLA (Multi-Latent Attention) with MuonSplit adaptation
MTP有,参数共享设计
总Token28.5T
阶段Pre-training + Mid-training(多阶段)
上下文最终200K

关键架构改进(相比GLM-4.5)

① 规模扩展策略

  • 从355B/32B(GLM-4.5) → 744B/40B(GLM-5)
  • 从160experts/89layers → 256experts/80layers:减层数(减少EP通信开销),增expert数

② MLA + MuonSplit

  • 问题:MLA在Muon优化器下性能不及GQA-8
  • 做法:将MLA的up-projection矩阵(W_UQ, W_UK, W_UV)按head拆分为小矩阵,分别做matrix orthogonalization(原来是对整个大矩阵做)
  • 效果:MLA性能匹配GQA-8;且注意力logits在训练中自然稳定,无需clipping

③ MLA-256head dimension

  • 将head dimension从192提升到256,attention head数减少1/3
  • 训练计算和参数量不变,但decoding计算降低(dot product 256-dim vs原576-dim latent)

Mid-training

阶段Token预算序列长度
Stage 11T32K
Stage 2500B128K
Stage 350B200K

数据重点:

  • 软件工程:10M issue-PR pairs(放宽repo过滤+加强issue级过滤),含更多relevant files,~160B unique tokens
  • 长上下文:natural(books/papers/docs) + synthetic(NextLong/EntropyLong启发,interleaved packing构建长距离依赖)
  • 200K阶段额外引入MRCR-like data多种变体

训练数据

项目详情
Web沿用GLM-4.5 pipeline + 新增DCLM classifier做quality filtering
过滤LLM打分,仅保留最educational内容;长文档用chunk-and-aggregate算法提升打分精度
严格排除合成/AI生成/模板化数据

Infra设计

项目详情
Memory效率Flexible MTP placement:MTP层灵活分配到pipeline stages
其他原文提到interleaved pipeline parallelism,具体细节参考单独mHC paper

2. 后训练 Recipe

SFT

项目详情
数据三大类:General Chat + Reasoning + Coding&Agent
Max context202,752 tokens
关键创新三种Thinking模式

三种Thinking模式:

模式描述
Interleaved Thinking每次response和tool call前都think,提升指令遵循和生成质量
Preserved Thinkingcoding agent场景中,跨多轮保留所有thinking blocks,复用已有推理不重新推导,适合长horizon复杂任务
Turn-level Thinking支持每轮单独控制是否think,轻量请求关闭减少延迟/成本,复杂任务打开提升准确性

RL Pipeline(三阶段顺序)

阶段内容
ReasoningRL数学/代码/科学推理
Agentic RL异步RL,长horizon agent任务
General RLhuman-style alignment
最终On-Policy Cross-Stage Distillation

3. RL Recipe

算法

项目详情
基础算法Group-wise Policy Optimization (类GRPO)
AgentRL仅对model-generated tokens计算loss,忽略environment feedback tokens

关键设计:Asynchronous RL for Agentic Tasks

问题:Agent rollout有严重长尾分布,同步RL大量GPU idle

做法

  • 训练引擎和推理引擎分离到不同GPU设备
  • 推理引擎持续生成trajectories,累积到阈值后发送给训练引擎
  • 每K次梯度更新后,训练引擎将新权重push回推理引擎
  • 每次weight update后reset optimizer(因为优化问题已改变)

Server-based Multi-Task Rollout Orchestrator

  • 每个task实现独立rollout+reward微服务,注册到中央orchestrator
  • orchestrator控制per-task rollout ratio和生成速度
  • 所有agentic task的trajectories标准化为统一message-list表示
  • 支持异构workload的joint training

关键设计:On-Policy Cross-Stage Distillation

  • 问题:多阶段RL顺序优化不同目标会导致先前能力退化
  • 做法:最终阶段用on-policy distillation快速恢复各阶段技能
  • 前序阶段(SFT/ReasoningRL/GeneralRL)的final checkpoints作为teacher
  • Advantage计算:Â{i,t} = sg[log(π_teacher(y{i,t}|…) / πtrain(y{i,t}|…))](用teacher与当前model的log概率差作advantage)
  • group size设为1(不需要同prompt多sample来估计advantage),batch size=1024

    Infra设计:Slime框架增强

项目详情
Scaling Out高度可定制rollout接口 + HTTP API暴露rollout server,外部agent框架可直接调用
Scaling Up①No-queue serving: EP64+DP64多节点推理+DP-attention避免KV跨rank拷贝 ②FP8 rollout + MTP 降低per-token延迟 ③Prefill-Decode disaggregation
鲁棒性Heartbeat-driven rollout fault tolerance + router-level server lifecycle management
目标最小化tail latency(而非throughput),因RL步骤受最慢sample制约

Agent RL 数据构造

任务类型方法
Software EngineeringLLM生成language-aware log-parsing函数提取F2P/P2P test cases,构建10K+可验证环境,跨9种语言
Terminal Environments①从seed tasks用LLM生成Harbor格式任务(Docker化+test scripts),refine agent迭代优化,>90%构建准确率 ②从web corpus自动合成,closed-loop自验证
Search Tasks报告提到有deep-search信息检索任务合成pipeline

4. 关键亮点

  1. MuonSplit for MLA:按head拆分做矩阵正交化,解决MLA在Muon下性能差的问题
  2. 三种Thinking模式:Interleaved/Preserved/Turn-level,灵活控制推理粒度
  3. Fully Async Agentic RL:训练推理解耦+Server-based Multi-Task Orchestrator+weight periodic sync
  4. On-Policy Cross-Stage Distillation:用teacher log-prob差作advantage,group size=1高吞吐恢复各阶段能力
  5. 200K上下文:三阶段context extension (32K→128K→200K)
  6. Slime框架增强:HTTP API + PD disaggregation + FP8 + MTP,优化tail latency
  7. 10K+可验证coding环境:跨9语言,用LLM自动化构建+验证
  8. LM Arena #1 open model:Text Arena和Code Arena均为开源第一
本文结束 感谢您的阅读