解读 Qwen3.5-Omni 的全模态架构:Thinker 与 Talker 均采用混合 MoE 加 GDN 提升长音视频推理效率、用 ARIA 统一文本与语音交错的单流生成以消除双轨同步开销,并通过在线策略蒸馏缩小语音回复的质量差距。
Qwen3.5-Omni —技术报告摘要
论文:Qwen3.5-Omni Technical Report (arXiv:2604.15804)
团队:Qwen Team /阿里巴巴
发布时间:2026.04
页数:28页
1. 预训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 架构 | Thinker-Talker,双模块均采用Hybrid-Attention MoE |
| 基座 | 基于Qwen3.5 Hybrid MoE backbone(含GDN模块) |
| Thinker | 负责文本生成:接收Vision Encoder + AuT编码的多模态输入 |
| Talker | 负责流式语音生成:条件于多模态输入+Thinker文本输出,预测RVQ codec tokens |
| GDN在Omni中的作用 | 加速长音视频序列建模,大幅降低KV-cache I/O开销,提高生成吞吐和serving并发 |
| 上下文 | 256K tokens(支持10h+音频,400s720P视频@1FPS) |
| 流式设计 | Thinker chunk-wise streaming input + Talker streaming generation |
| ARIA | Adaptive Rate Interleave Alignment:动态对齐text和speech token的生成速率,统一交错单流 |
| 语音表示 | RVQ-based multi-codebook codec,MTP模块预测residual codebooks,Code2Wav逐帧合成 |
| 音频编码器(AuT) | 40M小时监督数据训练,支持113种语言/方言ASR |
训练数据
| 项目 | 详情 |
|---|---|
| 模态覆盖 | image-text, video-text, audio-text, video-audio, video-audio-text, pure text |
| 音视频数据 | 100M+小时音视频内容 |
| 语言覆盖 | 201种语言(文本),113种(语音输入),36种(语音合成) |
| 数据增强 | 使用多样化自然语言prompt提升泛化和instruction-following |
| 训练方式 | 早期即联合unimodal + cross-modal数据 |
| TMRoPE改进 | 时间戳显式插入音视频输入中,改善长视频temporal perception |
Infra设计
| 项目 | 详情 |
|---|---|
| Chunked Prefilling | 音频/视觉编码器沿temporal维度输出chunks,显著降低TTFT |
| Hybrid MoE | Thinker和Talker均基于Qwen3.5 Hybrid MoE,GDN加速长序列 |
| 延迟数据(Plus,1并发) | Thinker TTFT: 162ms(audio)/377ms(video), Talker TTFC: 54ms, Overall: 435ms/651ms |
| Generation RTF | 0.187(Plus, 1并发) |
| 推理引擎 | 内部vLLM + torch.compile + CUDA Graph |
2. 后训练 Recipe — Thinker (3阶段)
Stage 1: Capability SFT
| 项目 | 详情 |
|---|---|
| 方法 | 多能力联合SFT |
| 数据 | 扩展text-based对话、reasoning、coding、agentic tasks |
| Teacher | 从pre-trained Qwen-3.5 base checkpoint fine-tune的teacher models |
| 多模态 | 音频对话、视觉理解等任务数据 |
Stage 2: On-Policy Distillation (OPD)
| 项目 | 详情 |
|---|---|
| 问题 | audio-conditioned response质量 << text-conditioned response |
| 方法 | 对每个audio-text paired query,先用text条件生成高质量response,再作为audio条件的distillation target |
| 效果 | 逐步对齐audio-conditioned输出和text-conditioned行为,缩小模态gap |
Stage 3: Interaction-Aligned RL
| 项目 | 详情 |
|---|---|
| 问题 | 多轮对话中出现语言code-switching、persona不一致、长上下文instruction-following退化 |
| 方法 | 构造多轮interaction trajectories +设计围绕用户体验目标的reward signals |
| 目标 | 优化prolonged interactions中的稳定性、一致性、对齐度 |
3. 后训练 Recipe — Talker (4阶段)
| 阶段 | 详情 |
|---|---|
| Stage1 General | 20M+小时多语言语音数据 + 多模态上下文训练;引入instruction-following speech generation等多样化任务 |
| Stage2 Long-Context | 数据质量分层筛选 + CPT on高质量子集;Qwen3-Omni-Captioner缓解hallucination;扩展上下文到64K |
| Stage3 RL | DPO(人工标注多语言偏好对)+ GSPO(rule-based rewards),提升能力和训练稳定性 |
| Stage4 Speaker Fine-tuning | 轻量级speaker特征微调,提升自然度/表达性/可控性 |
4. 关键亮点
- Hybrid MoE + GDN用于Omni模型:Thinker和Talker均采用,长音视频推理效率大幅提升
- ARIA:统一text/speech交错单流生成,消除双轨同步开销,减少skipped words/pronunciation errors
- On-Policy Distillation:text→audio模态蒸馏,缩小audio response质量gap
- Interaction-Aligned RL:专门针对多轮交互体验的RL阶段
- AuT:40M小时监督训练的音频编码器,113种语言ASR
- 215项音视频任务SOTA,超越Gemini-3.1Pro

