解读 Gemma 3 的三大关键设计:5:1 的局部与全局交替注意力配合 1024 滑窗在 128K 上下文下大幅压缩 KV 缓存、覆盖全尺寸的知识蒸馏,以及 SigLIP 视觉编码器固定压缩为 256 个视觉 token 的多模态方案。
Gemma 3 技术报告摘要
论文:Gemma 3 Technical Report
团队:Gemma Team, Google DeepMind
时间:2025.03(arXiv:2503.19786)
页数:25页
1. 预训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 模型系列 | 1B / 4B / 12B / 27B (全Dense) |
| 注意力 | Local-Global交替:每5个local层 + 1个global层,首层为local |
| Local attention | Sliding window = 1024 tokens |
| Global attention | Full attention,支持128K上下文 |
| KV cache优化 | 仅global层需存储长序列KV,local层只存1024 tokens → 大幅减少KV cache内存 |
| 上下文 | 128K tokens(1B模型为32K) |
| RoPE | Global层base frequency从10K提升到1M;Local层保持10K |
| 训练核心 | 知识蒸馏:所有模型用大teacher模型蒸馏训练 |
| Tokenizer | 与Gemini2.0相同:SentencePiece,262K词表,split digits + byte-level encoding,更均衡的非英语覆盖 |
训练数据
| 项目 | 详情 |
|---|---|
| Token预算 | 27B: 14T; 12B: 12T; 4B: 4T; 1B: 2T |
| 数据组成 | text + images混合 |
| 多语言 | 相比Gemma 2增加多语言数据量,加入monolingual和parallel data |
| 语言平衡 | 受Chung et al.(2023)启发的不平衡处理策略 |
| 过滤 | 去除unsafe utterances、个人信息、敏感数据;评估集decontamination;quality reweighting(受Sachdeva et al. 2024启发)减少低质量数据 |
| 蒸馏logits | 每token采样256个logits,按teacher概率加权 |
关键设计:Vision Modality
| 项目 | 详情 |
|---|---|
| Vision Encoder | SigLIP400M variant (ViT, trained with CLIP loss variation) |
| 输入 | 固定分辨率方形图片 + Pan and Scan (P&S)方法支持灵活分辨率(LLaVA启发) |
| 压缩 | Vision embeddings压缩为固定256个vector |
| 共享 | 4B/12B/27B共享同一vision encoder (417M params) |
| 训练优化 | 预计算image embeddings后直接训练,不增加训练成本 |
Infra设计
| 项目 | 详情 |
|---|---|
| 硬件 | TPUv4, TPUv5e, TPUv5p |
| 配置 | 1B: TPUv5e 512chips; 4B: TPUv5e 2048chips; 12B: TPUv4; 27B: TPUv5p |
| 优化 | 每个模型配置优化以最小化training step time |
| QAT | 提供量化版本:per-channel int4, per-block int4, switched fp8(约5000步微调) |
2. 后训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 方法 | 改进版知识蒸馏(from large IT teacher)+RL微调 |
| 蒸馏 | 改进版knowledge distillation (Agarwal et al., 2024) |
| RL方法 | 基于BOND + WARM + WARP的改进版本 |
| RL目标 | 多种reward function:helpfulness, math, coding, reasoning, instruction-following, multilingual |
| 新增能力 | 长上下文 + 图像输入的整合 |
训练数据
| 项目 | 详情 |
|---|---|
| 原文未详述后训练数据量和组成 | 仅提到通过蒸馏+RL显著提升math/chat/instruction-following/multilingual |
3. RL Recipe
| 项目 | 详情 |
|---|---|
| 算法 | BOND + WARM + WARP的改进版本 |
| Reward | 多种reward functions覆盖不同能力维度 |
| 具体超参和数据量 | 原文未详述 |
4. 关键亮点
- Local-Global交替注意力:5:1 local:global ratio + 1024 sliding window,128K context下大幅减少KV cache内存
- 全系列知识蒸馏:从大teacher蒸馏训练所有尺寸,4B-IT性能匹配Gemma2-27B-IT
- SigLIP vision +256 vector压缩:固定256个visual tokens,推理成本可控
- Pan and Scan:LLaVA启发的灵活分辨率方案
- QAT量化:官方提供int4/fp8量化版本,仅5000步微调
- 262K tokenizer:与Gemini 2.0共享,更均衡的多语言支持
- 27B模型达到Chatbot Arena Top 10:Elo 1338,开源Dense模型最强

