Seed1.5-VL 技术报告解读:原生分辨率视觉与混合可验证奖励强化学习

解读字节跳动 Seed1.5-VL:原生动态分辨率的 SeedViT 视觉编码器、只监督最终输出而不约束思维链的监督策略,以及联合 RLHF 与 RLVF 并用视觉语言模型自身充当奖励模型的混合强化学习方案。

Seed1.5-VL —技术报告摘要

论文:Seed1.5-VL Technical Report (arXiv:2505.07062)
团队:ByteDance Seed
发布时间:2025.05
页数:77页


1. 预训练 Recipe

训练策略

项目详情
架构ViT(532M) + MLP Adapter + MoE LLM(20B active)
Vision Encoder(SeedViT)原生动态分辨率,2D RoPE位置编码,支持任意尺寸图像;2×2average pooling压缩
Video编码Dynamic Frame-Resolution Sampling:动态调整采样帧率和分辨率 + timestamp tokens增强时序感知
LLMMoE,20B activated(总参未详述)
预训练联合训练ViT + Adapter + LLM全参数联合更新,NTP loss
Scaling Law发现OCR/grounding数据量与loss的power-law关系;loss与下游metric近似log-linear

训练数据

项目详情
数据类别Generic image-text pairs, knowledge data, OCR, visual grounding & counting,3D spatial understanding, video, STEM, GUI
数据管线长尾视觉概念重采样;多级质量过滤(rule-based + domain-based)
预训练数据量原文未给具体token数

Infra设计

项目详情
并行策略Hybrid: Expert Parallelism + Interleaved Pipeline Parallelism + ZeRO-1 DP + Context Parallelism
Encoder/LLM分离编码器和适配器使用单独并行策略,避免pipeline-level imbalance
Workload Balancing处理vision samples varying image count导致的计算不均
Fault ToleranceByteCheckpoint高效checkpoint保存/恢复

2. 后训练 Recipe (SFT)

训练策略

项目详情
两类SFT数据①General Instruction:多样复杂指令,简洁准确回答 ②Long CoT:详细step-by-step reasoning
LongCoT生成Prompt engineering生成(非人工标注)
训练方式SFT后接iterative update(rejection sampling + online RL交替)

3. RL Recipe

训练策略

项目详情
Hybrid RLRLHF + RLVF(verifiable rewards)联合训练
RLHFPreference data → VLM as Reward Model(用VLM本身做RM)
RLVFVisual STEM(rule-based verifier)+ Visual Perception and Reasoning
关键设计仅监督final output,不监督detailed CoT reasoning过程(让模型自由探索reasoning path)
Iterative UpdateRejection Sampling Fine-tuning迭代:收集hard prompts → rejection sampling → SFT → RL → loop
数据策展Hard Prompts收集+筛选pipeline,持续增强post-training数据

Infra设计

项目详情
框架verl-based:single-controller(inter-role dataflow)+ multi-controllers(intra-role parallelism)
VerifierProcess-based services隔离verifier faults
训练Actor/Critic: 3-D parallelism;Rollout/Reward/Reference: replicas + TP
成本RL phase60K GPU hours;Reward model training 24K GPU hours
推理引擎vLLM for rollout generation

4. 关键亮点

  1. SeedViT:原生动态分辨率ViT,2D RoPE,无需固定输入分辨率
  2. 仅监督final output不监督CoT:让模型自由探索reasoning path,避免约束思维
  3. Hybrid RL (RLHF + RLVF):verifiable和non-verifiable任务联合训练
  4. VLM as Reward Model:用VLM本身做reward model
  5. Multimodal Scaling Law:发现OCR/grounding loss与数据量的power-law,以及loss→metric的log-linear关系
  6. 38/60 public benchmarks SOTA;Agent任务超OpenAI CUA和Claude 3.7
  7. Iterative Update:rejection sampling + online RL交替迭代持续提升
本文结束 感谢您的阅读