Qwen3.5-Omni 技术报告解读:ARIA 单流生成与在线策略蒸馏

解读 Qwen3.5-Omni 的全模态架构:Thinker 与 Talker 均采用混合 MoE 加 GDN 提升长音视频推理效率、用 ARIA 统一文本与语音交错的单流生成以消除双轨同步开销,并通过在线策略蒸馏缩小语音回复的质量差距。

Qwen3.5-Omni —技术报告摘要

论文:Qwen3.5-Omni Technical Report (arXiv:2604.15804)
团队:Qwen Team /阿里巴巴
发布时间:2026.04
页数:28页


1. 预训练 Recipe

训练策略

项目详情
架构Thinker-Talker,双模块均采用Hybrid-Attention MoE
基座基于Qwen3.5 Hybrid MoE backbone(含GDN模块)
Thinker负责文本生成:接收Vision Encoder + AuT编码的多模态输入
Talker负责流式语音生成:条件于多模态输入+Thinker文本输出,预测RVQ codec tokens
GDN在Omni中的作用加速长音视频序列建模,大幅降低KV-cache I/O开销,提高生成吞吐和serving并发
上下文256K tokens(支持10h+音频,400s720P视频@1FPS
流式设计Thinker chunk-wise streaming input + Talker streaming generation
ARIAAdaptive Rate Interleave Alignment:动态对齐text和speech token的生成速率,统一交错单流
语音表示RVQ-based multi-codebook codec,MTP模块预测residual codebooks,Code2Wav逐帧合成
音频编码器(AuT)40M小时监督数据训练,支持113种语言/方言ASR

训练数据

项目详情
模态覆盖image-text, video-text, audio-text, video-audio, video-audio-text, pure text
音视频数据100M+小时音视频内容
语言覆盖201种语言(文本),113种(语音输入),36种(语音合成)
数据增强使用多样化自然语言prompt提升泛化和instruction-following
训练方式早期即联合unimodal + cross-modal数据
TMRoPE改进时间戳显式插入音视频输入中,改善长视频temporal perception

Infra设计

项目详情
Chunked Prefilling音频/视觉编码器沿temporal维度输出chunks,显著降低TTFT
Hybrid MoEThinker和Talker均基于Qwen3.5 Hybrid MoE,GDN加速长序列
延迟数据(Plus,1并发)Thinker TTFT: 162ms(audio)/377ms(video), Talker TTFC: 54ms, Overall: 435ms/651ms
Generation RTF0.187(Plus, 1并发)
推理引擎内部vLLM + torch.compile + CUDA Graph

2. 后训练 Recipe — Thinker (3阶段)

Stage 1: Capability SFT

项目详情
方法多能力联合SFT
数据扩展text-based对话、reasoning、coding、agentic tasks
Teacher从pre-trained Qwen-3.5 base checkpoint fine-tune的teacher models
多模态音频对话、视觉理解等任务数据

Stage 2: On-Policy Distillation (OPD)

项目详情
问题audio-conditioned response质量 << text-conditioned response
方法对每个audio-text paired query,先用text条件生成高质量response,再作为audio条件的distillation target
效果逐步对齐audio-conditioned输出和text-conditioned行为,缩小模态gap

Stage 3: Interaction-Aligned RL

项目详情
问题多轮对话中出现语言code-switching、persona不一致、长上下文instruction-following退化
方法构造多轮interaction trajectories +设计围绕用户体验目标的reward signals
目标优化prolonged interactions中的稳定性、一致性、对齐度

3. 后训练 Recipe — Talker (4阶段)

阶段详情
Stage1 General20M+小时多语言语音数据 + 多模态上下文训练;引入instruction-following speech generation等多样化任务
Stage2 Long-Context数据质量分层筛选 + CPT on高质量子集;Qwen3-Omni-Captioner缓解hallucination;扩展上下文到64K
Stage3 RLDPO(人工标注多语言偏好对)+ GSPO(rule-based rewards),提升能力和训练稳定性
Stage4 Speaker Fine-tuning轻量级speaker特征微调,提升自然度/表达性/可控性

4. 关键亮点

  1. Hybrid MoE + GDN用于Omni模型:Thinker和Talker均采用,长音视频推理效率大幅提升
  2. ARIA:统一text/speech交错单流生成,消除双轨同步开销,减少skipped words/pronunciation errors
  3. On-Policy Distillation:text→audio模态蒸馏,缩小audio response质量gap
  4. Interaction-Aligned RL:专门针对多轮交互体验的RL阶段
  5. AuT:40M小时监督训练的音频编码器,113种语言ASR
  6. 215项音视频任务SOTA,超越Gemini-3.1Pro
本文结束 感谢您的阅读