Gemma 3 技术报告解读:局部全局交替注意力与全系列知识蒸馏

解读 Gemma 3 的三大关键设计:5:1 的局部与全局交替注意力配合 1024 滑窗在 128K 上下文下大幅压缩 KV 缓存、覆盖全尺寸的知识蒸馏,以及 SigLIP 视觉编码器固定压缩为 256 个视觉 token 的多模态方案。

Gemma 3 技术报告摘要

论文:Gemma 3 Technical Report
团队:Gemma Team, Google DeepMind
时间:2025.03(arXiv:2503.19786)
页数:25页


1. 预训练 Recipe

训练策略

项目详情
模型系列1B / 4B / 12B / 27B (全Dense)
注意力Local-Global交替:每5个local层 + 1个global层,首层为local
Local attentionSliding window = 1024 tokens
Global attentionFull attention,支持128K上下文
KV cache优化仅global层需存储长序列KV,local层只存1024 tokens → 大幅减少KV cache内存
上下文128K tokens(1B模型为32K)
RoPEGlobal层base frequency从10K提升到1M;Local层保持10K
训练核心知识蒸馏:所有模型用大teacher模型蒸馏训练
Tokenizer与Gemini2.0相同:SentencePiece,262K词表,split digits + byte-level encoding,更均衡的非英语覆盖

训练数据

项目详情
Token预算27B: 14T; 12B: 12T; 4B: 4T; 1B: 2T
数据组成text + images混合
多语言相比Gemma 2增加多语言数据量,加入monolingual和parallel data
语言平衡受Chung et al.(2023)启发的不平衡处理策略
过滤去除unsafe utterances、个人信息、敏感数据;评估集decontamination;quality reweighting(受Sachdeva et al. 2024启发)减少低质量数据
蒸馏logits每token采样256个logits,按teacher概率加权

关键设计:Vision Modality

项目详情
Vision EncoderSigLIP400M variant (ViT, trained with CLIP loss variation)
输入固定分辨率方形图片 + Pan and Scan (P&S)方法支持灵活分辨率(LLaVA启发)
压缩Vision embeddings压缩为固定256个vector
共享4B/12B/27B共享同一vision encoder (417M params)
训练优化预计算image embeddings后直接训练,不增加训练成本

Infra设计

项目详情
硬件TPUv4, TPUv5e, TPUv5p
配置1B: TPUv5e 512chips; 4B: TPUv5e 2048chips; 12B: TPUv4; 27B: TPUv5p
优化每个模型配置优化以最小化training step time
QAT提供量化版本:per-channel int4, per-block int4, switched fp8(约5000步微调)

2. 后训练 Recipe

训练策略

项目详情
方法改进版知识蒸馏(from large IT teacher)+RL微调
蒸馏改进版knowledge distillation (Agarwal et al., 2024)
RL方法基于BOND + WARM + WARP的改进版本
RL目标多种reward function:helpfulness, math, coding, reasoning, instruction-following, multilingual
新增能力长上下文 + 图像输入的整合

训练数据

项目详情
原文未详述后训练数据量和组成仅提到通过蒸馏+RL显著提升math/chat/instruction-following/multilingual

3. RL Recipe

项目详情
算法BOND + WARM + WARP的改进版本
Reward多种reward functions覆盖不同能力维度
具体超参和数据量原文未详述

4. 关键亮点

  1. Local-Global交替注意力:5:1 local:global ratio + 1024 sliding window,128K context下大幅减少KV cache内存
  2. 全系列知识蒸馏:从大teacher蒸馏训练所有尺寸,4B-IT性能匹配Gemma2-27B-IT
  3. SigLIP vision +256 vector压缩:固定256个visual tokens,推理成本可控
  4. Pan and Scan:LLaVA启发的灵活分辨率方案
  5. QAT量化:官方提供int4/fp8量化版本,仅5000步微调
  6. 262K tokenizer:与Gemini 2.0共享,更均衡的多语言支持
  7. 27B模型达到Chatbot Arena Top 10:Elo 1338,开源Dense模型最强
本文结束 感谢您的阅读