Gemma 4 技术报告解读:P-RoPE 与键值复用的极简长上下文设计

解读 Gemma 4 的架构创新:仅对 25% 头维度施加 RoPE 的 p-RoPE 让全局 KV 缓存减少 37.5%、全局层直接用 key 充当 value 进一步压缩缓存,以及去编码器的多模态设计与音频模态支持。

Gemma 4 技术报告摘要

论文:Gemma 4 Technical Report
团队:Gemma Team, Google DeepMind
时间:2026.07(arXiv:2607.02770)
页数:17页


1. 预训练 Recipe

训练策略

项目详情
模型系列Dense: E2B(2.3B effective/5B total), E4B(4.5B/8B), 12B, 31B; MoE: 26B-A4B(3.8B activated/26B total)
架构Decoder-only Transformer, pre-norm + post-norm (RMSNorm), QKNorm
注意力Local-Global交替(5:1, E2B为4:1)
位置编码p-RoPE (p=0.25) on global layers + standard RoPE on local layers
KV cache优化p-RoPE + KV sharing(ratios 20/35 and 18/42 for E2B/E4B) + keys reused as values in global layers → global KV cache减少37.5%
MTP自回归MTP drafter head,用于speculative decoding
训练方式沿用Gemma 3的知识蒸馏预训练
Tokenizer与Gemini共享,SentencePiece 262K词表

关键架构创新

① p-RoPE (Partial RoPE)

  • 在global attention层仅对25% (p=0.25)的head dimensions应用RoPE
  • 其余75%不加位置编码
  • 效果:global KV cache减少37.5%

② Keys as Values in Global Layers

  • Global层中key直接复用为value
  • 进一步减少KV cache存储

③ Encoder-Free Architecture (12B模型)

  • 不使用独立的vision/audio encoder
  • 直接将raw40ms audio chunks和image patches投射到LLM embedding space
  • 消除单独encoder需求,减少内存碎片

④ Per-layer Embeddings (E2B, E4B)

  • 使用per-layer embeddings使小模型effective参数更少(5B total→2.3B effective)

训练数据

项目详情
来源web documents, code, images, audio
CutoffJanuary 2025
AudioE2B/E4B/12B支持audio
具体token数原文未详述

Vision Modality

项目详情
E2B/E4B150M vision encoder (ViT, patch=16, 2D-RoPE + non-causal attention + 2D absolute PE)
26B-A4B/31B550M vision encoder
12BEncoder-free,直接投射raw patches
输入支持variable aspect ratios
Max tokens70/140/280/560/1120 (per algorithm)
Encoder QAT150M encoder W8A8→2× memory reduction, 44% latency reduction

Audio Modality

项目详情
Encoder305M audio encoder (E2B/E4B)
处理40ms chunks, Mel filterbank输入
量化activation8-bit, weights {2,4,8}-bit varying by layer

Infra设计

项目详情
硬件TPUv4, TPUv6e
E2BTPUv6e 4096 chips
E4BTPUv6e 6144 chips
12BTPUv4
编译器MegaScale XLA compiler

2. 后训练 Recipe

训练策略

项目详情
方法与Gemma 3类似:knowledge distillation from large IT teacher +RL
关键新增Thinking mode:模型可在回答前输出reasoning trace
Data filtering仔细优化后训练数据以最大化模型性能
PT vs ITPT模型输出<eos>,IT模型输出`<turn
具体RL算法/数据量原文未详述(与Gemma 3类似)

MTP Drafter

项目详情
架构小型Transformer block (dim=256 for E2B/E4B, 1024 for larger), 3 local + 1 global attention layer
功能MTP prefill + 支持任意draft length
E2B/E4B优化用top-k on clusters替代full vocabulary projection,降低decoding overhead

3. RL Recipe

项目详情
原文未详述仅提及与Gemma 3类似的post-training approach + thinking mode addition

4. 关键亮点

  1. p-RoPE:仅25%维度应用RoPE,global KV cache减37.5%
  2. Keys as Values:global层key复用为value,进一步省KV
  3. Encoder-Free 12B:直接投射raw audio/image patches,无需单独encoder
  4. Thinking Mode:reasoning trace before response
  5. MTP Drafter:speculative decoding加速推理
  6. Dense 31B = Arena Top open Dense model:Elo 1451,匹敌更大MoE模型
  7. 完整Audio支持:Mel filterbank→40ms chunks,audio encoder支持{2,4,8}-bit量化
  8. Per-layer Embeddings:E2B/E4B用5B/8B total参数实现2.3B/4.5B effective
本文结束 感谢您的阅读