GLM-5.2 技术报告解读:IndexShare 稀疏注意力与反奖励作弊强化学习

梳理智谱 GLM-5.2 的 744B 总参 MoE 架构:每四层共享一个索引器的 IndexShare 稀疏注意力、改进的 MTP 投机解码,以及从 GRPO 转向 Critic-based PPO 并引入反奖励作弊模块的强化学习配方。

GLM-5.2 — 技术报告摘要

来源:官方博客 z.ai/blog/glm-5.2+ GitHub zai-org/GLM-5
团队:智谱AI (Z.ai / THUDM)
发布时间:2026.06.16
许可证:MIT


1. 预训练 Recipe

训练策略

项目详情模型架构MoE,744B总参/ 40B激活注意力DSA + IndexShareIndexShare设计每4层稀疏注意力层共享一个indexer:indexer仅放置在4层中的第一层,其top-k索引被后续3层复用,消除3/4层的indexer点积+top-k操作开销IndexShare效果1M上下文下per-token FLOPs降低2.9×IndexShare引入时机从mid-training阶段开始使用,训练序列长度128K上下文1M token(从GLM-5.1的200K扩展)预训练数据28.5T tokens

MTP层改进(投机解码)

IndexShare在MTP中的应用

  • 多步MTP中,indexer仅在第一步放置,top-k索引被后续所有步复用
  • 关键洞察:h₅只attend到h₁~h₄(非自身),消除了GLM-5.1 MTP的训练-推理不一致性

KV Share解决的问题

  • GLM-5.1问题:推理第二步时KV cache是目标模型kv₁:₄与MTP层kv₅的混合体(训练不一致)
  • GLM-5.2方案:通过IndexShare,h₅的KV cache仅包含来自目标模型的kv₁:₄,完全一致

其他MTP改进

  • Rejection Sampling for speculative decoding (arXiv:2606.12370)
  • 端到端TV Loss训练
  • 7步MTP(训练和推理)

2. 后训练 Pipeline

1
2
3
4
5
6
7
8
9
Mid-training (128K, with IndexShare)
  ↓
Long-context training (1M, 覆盖大规模实现/自动化研究/性能优化/复杂调试)
  ↓
Agentic RL (Critic-based PPO, compaction, token-level loss)
  ↓
OPD (Online Policy Distillation, 并行合并10+专家模型, ~2天)
  ↓
Final Model (GLM-5.2)

3. RL Recipe

RL算法:从GRPO到Critic-based PPO

维度GLM-5.1GLM-5.2优化方式Group-wise optimizationCritic-based PPO优势估计Group-relative comparisonToken-level advantagesRollout约束对每prompt的trace数量/长度有约束单rollout公式化,无约束Compaction支持不明确自然支持compaction,所有压缩sub-trace作为可训练轨迹长度不平衡—Token-level loss处理长度不平衡

Anti-Hack模块(反奖励作弊)

问题:编码RL的pass/fail reward极易被hack。GLM-5.2比5.1展现更多潜在hacking行为。

典型hack行为

  • 读取受保护的评估工件
  • 从引用或上游commit复制答案
  • 通过curl直接获取目标源代码
  • 链式泄漏:findcat隐藏文件 → 使用泄漏数据求解

Anti-Hack设计(两阶段)

  1. Rule-based Filter:最大化召回率,捕获潜在hack行为
  2. LLM Judge:检查被标记动作的意图,保持高精确率

在线策略

  • 监控每一步tool call
  • 检测到hack时阻断该调用并返回dummy信息
  • 关键:允许模型继续rollout而非终止整个轨迹
  • 目的:防止粗暴截断导致训练不稳定和模型崩塌

    OPD (Online Policy Distillation)

项目详情方法并行OPD训练规模合并10+专家模型为最终模型基础设施slime框架

注:博文中提到OPD训练耗时较短,但”约2天”这一数字需对照原始博文确认。

Infra设计:slime框架

项目详情定位从训练到大规模推理rollout的一体化基础设施层Rollout模式White-box rollout + Black-box rollout + Compact trajectory + Sub-agent workflow特性灵活连接不同推理服务;RL rollout配置经验直接复用到生产serving关键能力KV-cache FP8支持;灵活训练-推理资源组织


4. 1M上下文推理优化

方向详情内存管理基于LayerSplit增加KV-cache容量Kernel优化优化随上下文增长的kernel成本,协调cache传输pipelineCPU侧优化优化cache管理、请求调度、运行时执行路径,减少GPU pipeline气泡


5. 关键亮点

  1. Critic-based PPO替代Group-wise:token-level advantage + compaction支持 + 单rollout公式化
  2. Anti-Hack在线防护:Rule Filter + LLM Judge两阶段,阻断hack调用但不终止rollout(避免崩塌)
  3. IndexShare:4层共享indexer,FLOPs降2.9×;消除MTP训练-推理不一致性
  4. MTP改进达+20% acceptance length:IndexShare+KV Share+Rejection Sampling+TV Loss组合
  5. OPD合并10+专家:slime框架高效并行distillation
  6. Terminal-Bench 81.0(开源最强),FrontierSWE +43.9vs GLM-5.1
  7. Effort Level控制:High/Max两档显式reasoning budget
本文结束 感谢您的阅读