解读字节跳动 Seed1.5-VL:原生动态分辨率的 SeedViT 视觉编码器、只监督最终输出而不约束思维链的监督策略,以及联合 RLHF 与 RLVF 并用视觉语言模型自身充当奖励模型的混合强化学习方案。
Seed1.5-VL —技术报告摘要
论文:Seed1.5-VL Technical Report (arXiv:2505.07062)
团队:ByteDance Seed
发布时间:2025.05
页数:77页
1. 预训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 架构 | ViT(532M) + MLP Adapter + MoE LLM(20B active) |
| Vision Encoder(SeedViT) | 原生动态分辨率,2D RoPE位置编码,支持任意尺寸图像;2×2average pooling压缩 |
| Video编码 | Dynamic Frame-Resolution Sampling:动态调整采样帧率和分辨率 + timestamp tokens增强时序感知 |
| LLM | MoE,20B activated(总参未详述) |
| 预训练联合训练 | ViT + Adapter + LLM全参数联合更新,NTP loss |
| Scaling Law | 发现OCR/grounding数据量与loss的power-law关系;loss与下游metric近似log-linear |
训练数据
| 项目 | 详情 |
|---|---|
| 数据类别 | Generic image-text pairs, knowledge data, OCR, visual grounding & counting,3D spatial understanding, video, STEM, GUI |
| 数据管线 | 长尾视觉概念重采样;多级质量过滤(rule-based + domain-based) |
| 预训练数据量 | 原文未给具体token数 |
Infra设计
| 项目 | 详情 |
|---|---|
| 并行策略 | Hybrid: Expert Parallelism + Interleaved Pipeline Parallelism + ZeRO-1 DP + Context Parallelism |
| Encoder/LLM分离 | 编码器和适配器使用单独并行策略,避免pipeline-level imbalance |
| Workload Balancing | 处理vision samples varying image count导致的计算不均 |
| Fault Tolerance | ByteCheckpoint高效checkpoint保存/恢复 |
2. 后训练 Recipe (SFT)
训练策略
| 项目 | 详情 |
|---|---|
| 两类SFT数据 | ①General Instruction:多样复杂指令,简洁准确回答 ②Long CoT:详细step-by-step reasoning |
| LongCoT生成 | Prompt engineering生成(非人工标注) |
| 训练方式 | SFT后接iterative update(rejection sampling + online RL交替) |
3. RL Recipe
训练策略
| 项目 | 详情 |
|---|---|
| Hybrid RL | RLHF + RLVF(verifiable rewards)联合训练 |
| RLHF | Preference data → VLM as Reward Model(用VLM本身做RM) |
| RLVF | Visual STEM(rule-based verifier)+ Visual Perception and Reasoning |
| 关键设计 | 仅监督final output,不监督detailed CoT reasoning过程(让模型自由探索reasoning path) |
| Iterative Update | Rejection Sampling Fine-tuning迭代:收集hard prompts → rejection sampling → SFT → RL → loop |
| 数据策展 | Hard Prompts收集+筛选pipeline,持续增强post-training数据 |
Infra设计
| 项目 | 详情 |
|---|---|
| 框架 | verl-based:single-controller(inter-role dataflow)+ multi-controllers(intra-role parallelism) |
| Verifier | Process-based services隔离verifier faults |
| 训练 | Actor/Critic: 3-D parallelism;Rollout/Reward/Reference: replicas + TP |
| 成本 | RL phase60K GPU hours;Reward model training 24K GPU hours |
| 推理引擎 | vLLM for rollout generation |
4. 关键亮点
- SeedViT:原生动态分辨率ViT,2D RoPE,无需固定输入分辨率
- 仅监督final output不监督CoT:让模型自由探索reasoning path,避免约束思维
- Hybrid RL (RLHF + RLVF):verifiable和non-verifiable任务联合训练
- VLM as Reward Model:用VLM本身做reward model
- Multimodal Scaling Law:发现OCR/grounding loss与数据量的power-law,以及loss→metric的log-linear关系
- 38/60 public benchmarks SOTA;Agent任务超OpenAI CUA和Claude 3.7
- Iterative Update:rejection sampling + online RL交替迭代持续提升

