逐项对比 Qwen3 与 Qwen3.5 的架构差异:混合 SSM-Transformer 设计、Gated DeltaNet 线性注意力层的参数构成、视觉编码器与图文对齐方式的演进,并解释 DeepStack 为何在 Qwen3.5 中消失以及序列并行支持的取舍。
Qwen3.5代表了阿里通义团队在 大模型架构效率革命 方面的重大突破。通过 混合注意力机制 + 极致稀疏MoE + 原生多模态支持 的组合,Qwen3.5实现了训练成本降低90%、推理吞吐提升10倍+、性能媲美更大规模模型的卓越表现。Qwen3.5采用 Qwen3-Next架构的优化版本 ,这是一个 混合SSM-Transformer设计 ,首次实现了 原生视觉语言模型(VLM) 支持。
交互式架构对比
注意力机制:从标准 Transformer 到混合架构

Qwen3.5 由于注意力实现的特殊性,目前不支持序列并行(Sequence Parallelism),而 Qwen3 的标准注意力则兼容该特性。
线性注意力层的 SSM 参数
Gated DeltaNet 的实现依赖一组 Qwen3 完全不具备的 SSM(State Space Model)组件参数:

此外还有一组专门控制线性注意力行为的超参数:

视觉编码器与图文对齐
Qwen 系列 Vision Backbone 演进


图文对齐:约束只有一条 LM Loss

这背后有一个克制的工程决策:所有视觉任务被统一改写成文本生成。


三阶段训练:对齐压力施加在哪一侧
Qwen-VL 与 Qwen2-VL 公开的训练管线都是三阶段,关键差异在每阶段冻结/解冻的组合——它决定了梯度往哪个方向传递、对齐压力施加在哪一侧。


Qwen3 → Qwen3.5:DeepStack 消失的真正原因

MoE 架构:迈向高稀疏化

位置编码:Partial RoPE 与百万级上下文

Tool Calling 格式的演进

总结:结构创新驱动的效率飞跃


来源:https://xuquant.com/posts/foundation-models/qwen3-vs-qwen3-5-architecture

