解读 Gemma 4 的架构创新:仅对 25% 头维度施加 RoPE 的 p-RoPE 让全局 KV 缓存减少 37.5%、全局层直接用 key 充当 value 进一步压缩缓存,以及去编码器的多模态设计与音频模态支持。
Gemma 4 技术报告摘要
论文:Gemma 4 Technical Report
团队:Gemma Team, Google DeepMind
时间:2026.07(arXiv:2607.02770)
页数:17页
1. 预训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 模型系列 | Dense: E2B(2.3B effective/5B total), E4B(4.5B/8B), 12B, 31B; MoE: 26B-A4B(3.8B activated/26B total) |
| 架构 | Decoder-only Transformer, pre-norm + post-norm (RMSNorm), QKNorm |
| 注意力 | Local-Global交替(5:1, E2B为4:1) |
| 位置编码 | p-RoPE (p=0.25) on global layers + standard RoPE on local layers |
| KV cache优化 | p-RoPE + KV sharing(ratios 20/35 and 18/42 for E2B/E4B) + keys reused as values in global layers → global KV cache减少37.5% |
| MTP | 自回归MTP drafter head,用于speculative decoding |
| 训练方式 | 沿用Gemma 3的知识蒸馏预训练 |
| Tokenizer | 与Gemini共享,SentencePiece 262K词表 |
关键架构创新
① p-RoPE (Partial RoPE)
- 在global attention层仅对25% (p=0.25)的head dimensions应用RoPE
- 其余75%不加位置编码
- 效果:global KV cache减少37.5%
② Keys as Values in Global Layers
- Global层中key直接复用为value
- 进一步减少KV cache存储
③ Encoder-Free Architecture (12B模型)
- 不使用独立的vision/audio encoder
- 直接将raw40ms audio chunks和image patches投射到LLM embedding space
- 消除单独encoder需求,减少内存碎片
④ Per-layer Embeddings (E2B, E4B)
- 使用per-layer embeddings使小模型effective参数更少(5B total→2.3B effective)
训练数据
| 项目 | 详情 |
|---|---|
| 来源 | web documents, code, images, audio |
| Cutoff | January 2025 |
| Audio | E2B/E4B/12B支持audio |
| 具体token数 | 原文未详述 |
Vision Modality
| 项目 | 详情 |
|---|---|
| E2B/E4B | 150M vision encoder (ViT, patch=16, 2D-RoPE + non-causal attention + 2D absolute PE) |
| 26B-A4B/31B | 550M vision encoder |
| 12B | Encoder-free,直接投射raw patches |
| 输入 | 支持variable aspect ratios |
| Max tokens | 70/140/280/560/1120 (per algorithm) |
| Encoder QAT | 150M encoder W8A8→2× memory reduction, 44% latency reduction |
Audio Modality
| 项目 | 详情 |
|---|---|
| Encoder | 305M audio encoder (E2B/E4B) |
| 处理 | 40ms chunks, Mel filterbank输入 |
| 量化 | activation8-bit, weights {2,4,8}-bit varying by layer |
Infra设计
| 项目 | 详情 |
|---|---|
| 硬件 | TPUv4, TPUv6e |
| E2B | TPUv6e 4096 chips |
| E4B | TPUv6e 6144 chips |
| 12B | TPUv4 |
| 编译器 | MegaScale XLA compiler |
2. 后训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 方法 | 与Gemma 3类似:knowledge distillation from large IT teacher +RL |
| 关键新增 | Thinking mode:模型可在回答前输出reasoning trace |
| Data filtering | 仔细优化后训练数据以最大化模型性能 |
| PT vs IT | PT模型输出<eos>,IT模型输出`<turn |
| 具体RL算法/数据量 | 原文未详述(与Gemma 3类似) |
MTP Drafter
| 项目 | 详情 |
|---|---|
| 架构 | 小型Transformer block (dim=256 for E2B/E4B, 1024 for larger), 3 local + 1 global attention layer |
| 功能 | MTP prefill + 支持任意draft length |
| E2B/E4B优化 | 用top-k on clusters替代full vocabulary projection,降低decoding overhead |
3. RL Recipe
| 项目 | 详情 |
|---|---|
| 原文未详述 | 仅提及与Gemma 3类似的post-training approach + thinking mode addition |
4. 关键亮点
- p-RoPE:仅25%维度应用RoPE,global KV cache减37.5%
- Keys as Values:global层key复用为value,进一步省KV
- Encoder-Free 12B:直接投射raw audio/image patches,无需单独encoder
- Thinking Mode:reasoning trace before response
- MTP Drafter:speculative decoding加速推理
- Dense 31B = Arena Top open Dense model:Elo 1451,匹敌更大MoE模型
- 完整Audio支持:Mel filterbank→40ms chunks,audio encoder支持{2,4,8}-bit量化
- Per-layer Embeddings:E2B/E4B用5B/8B total参数实现2.3B/4.5B effective

