Qwen3.5 技术报告解读:397B 稀疏 MoE 与原生多模态融合

梳理 Qwen3.5 旗舰模型 397B-A17B 的关键设计:线性注意力 GDN 替代 75% 标准注意力让 256K 上下文效率提升 19 倍、从预训练第一步就统一视觉语言的 Early Fusion、仅激活 4.3% 参数的极端稀疏 MoE,以及覆盖 201 种语言的 250K 词表。

Qwen3.5 — 技术报告摘要

来源:官方博文 + 阿里巴巴集团发布页(无独立arXiv PDF)
团队:Qwen Team / 阿里巴巴
发布时间:2026.02
旗舰模型:397B-A17B(MoE)


1. 预训练 Recipe

训练策略

项目详情
模型架构原生多模态 MoE,397B总参 / 17B激活(旗舰),激活比例4.3%
注意力Hybrid Attention:GDN(Gated Delta Networks)替代75%注意力层,仅保留25%全局注意力层(4:1交替)
GDN核心机制门控+增量状态更新实现O(n)近似注意力;KV Cache恒定大小(不随序列长度增长)
模态融合Early Fusion:图片/视频/文字统一Token化→同一潜空间→同一Transformer,从预训练第一步共享表示空间
MoE变体35B-A3B和122B-A10B采用MoE+GDN组合;397B-A17B为纯MoE
MTPMulti-Token Prediction
上下文256K→1M(渐进扩展)
词表250K(从Qwen3的150K扩展),支持201种语言/方言
效率32K解码吞吐 = Qwen3-Max的8.6×;256K = Qwen3-Max的19×

训练数据

项目详情
总量“数万亿”视觉+语言混合tokens(未给精确数字)
数据类型多语言文本、图像、视频、STEM、推理数据
语言覆盖201种语言/方言(含南亚、大洋洲、非洲低资源语言)
Audio数据1亿小时音视频数据(用于Audio Transformer预训练)
关键特点原生多模态训练:视觉+语言从预训练第一步联合
数据配比原文未详述

Infra设计

项目详情
原文未详述训练集群和并行策略

2. 后训练 Recipe (SFT)

项目详情
原文未详述SFT具体方法和数据仅从benchmark变化可推断进行了大量工具调用相关SFT
Agent能力变化Qwen3-27B 47.4% → Qwen3.5-27B 63.9%(+16.5%)
BFCL-V442.4 → 66.1

3. RL Recipe

项目详情
RL框架可扩展RL框架,支持纯文本/多模态/多轮交互
RL训练加速端到端训练速度提升3-5×
环境原生支持百万级Agent框架及环境
具体算法原文未详述(GRPO/DPO/PPO未指明)

4. 关键亮点

  1. GDN首次在旗舰生产规模模型中落地:线性注意力替代75%标准注意力,256K效率提升19×
  2. Early Fusion:原生多模态从预训练第一步统一,27B超越上代235B专用视觉模型
  3. 极端稀疏MoE:397B总参仅4.3%激活,35B模型仅需8GB显存
  4. 250K词表:201种语言/方言,中日文编码效率提升10-60%
  5. 注意:此为博文级信息,缺少完整训练细节(数据配比、RL算法、Infra设计等未披露)
本文结束 感谢您的阅读