梳理 Qwen3.5 旗舰模型 397B-A17B 的关键设计:线性注意力 GDN 替代 75% 标准注意力让 256K 上下文效率提升 19 倍、从预训练第一步就统一视觉语言的 Early Fusion、仅激活 4.3% 参数的极端稀疏 MoE,以及覆盖 201 种语言的 250K 词表。
Qwen3.5 — 技术报告摘要
来源:官方博文 + 阿里巴巴集团发布页(无独立arXiv PDF)
团队:Qwen Team / 阿里巴巴
发布时间:2026.02
旗舰模型:397B-A17B(MoE)
1. 预训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 模型架构 | 原生多模态 MoE,397B总参 / 17B激活(旗舰),激活比例4.3% |
| 注意力 | Hybrid Attention:GDN(Gated Delta Networks)替代75%注意力层,仅保留25%全局注意力层(4:1交替) |
| GDN核心机制 | 门控+增量状态更新实现O(n)近似注意力;KV Cache恒定大小(不随序列长度增长) |
| 模态融合 | Early Fusion:图片/视频/文字统一Token化→同一潜空间→同一Transformer,从预训练第一步共享表示空间 |
| MoE变体 | 35B-A3B和122B-A10B采用MoE+GDN组合;397B-A17B为纯MoE |
| MTP | Multi-Token Prediction |
| 上下文 | 256K→1M(渐进扩展) |
| 词表 | 250K(从Qwen3的150K扩展),支持201种语言/方言 |
| 效率 | 32K解码吞吐 = Qwen3-Max的8.6×;256K = Qwen3-Max的19× |
训练数据
| 项目 | 详情 |
|---|---|
| 总量 | “数万亿”视觉+语言混合tokens(未给精确数字) |
| 数据类型 | 多语言文本、图像、视频、STEM、推理数据 |
| 语言覆盖 | 201种语言/方言(含南亚、大洋洲、非洲低资源语言) |
| Audio数据 | 1亿小时音视频数据(用于Audio Transformer预训练) |
| 关键特点 | 原生多模态训练:视觉+语言从预训练第一步联合 |
| 数据配比 | 原文未详述 |
Infra设计
| 项目 | 详情 |
|---|---|
| 原文未详述训练集群和并行策略 | — |
2. 后训练 Recipe (SFT)
| 项目 | 详情 |
|---|---|
| 原文未详述SFT具体方法和数据 | 仅从benchmark变化可推断进行了大量工具调用相关SFT |
| Agent能力变化 | Qwen3-27B 47.4% → Qwen3.5-27B 63.9%(+16.5%) |
| BFCL-V4 | 42.4 → 66.1 |
3. RL Recipe
| 项目 | 详情 |
|---|---|
| RL框架 | 可扩展RL框架,支持纯文本/多模态/多轮交互 |
| RL训练加速 | 端到端训练速度提升3-5× |
| 环境 | 原生支持百万级Agent框架及环境 |
| 具体算法 | 原文未详述(GRPO/DPO/PPO未指明) |
4. 关键亮点
- GDN首次在旗舰生产规模模型中落地:线性注意力替代75%标准注意力,256K效率提升19×
- Early Fusion:原生多模态从预训练第一步统一,27B超越上代235B专用视觉模型
- 极端稀疏MoE:397B总参仅4.3%激活,35B模型仅需8GB显存
- 250K词表:201种语言/方言,中日文编码效率提升10-60%
- 注意:此为博文级信息,缺少完整训练细节(数据配比、RL算法、Infra设计等未披露)

