Kimi-K2.5 技术报告解读:视觉智能体与 Zero-Vision SFT

解读 Kimi-K2.5 面向视觉智能体的两项关键设计:固定视觉文本 token 预算下早期融合优于后期大量注入视觉这一预训练发现,以及解决多模态工具调用冷启动问题的 Zero-Vision SFT 方案。

Kimi-K2.5 技术报告摘要

论文:Kimi K2.5: Visual Agentic Intelligence
团队:Kimi Team (Moonshot AI)
时间:2026.03(arXiv:2602.02276)
页数:30页


1. 预训练 Recipe(Native Multimodal Pre-Training)

训练策略

项目详情
基座Kimi K2 (1T MoE, 32B activated)
方法在K2基础上做大规模joint pre-training,约15T mixed visual+text tokens
Vision EncoderMoonViT-3D:native-resolution encoder + NaViT packing strategy,支持variable-resolution image输入
Video处理轻量3D ViT compression:每4帧为一组,共享MoonViT encoder,patch级temporal averaging → 可处理4x更长的视频
Image/Video encoder完全weight sharing

关键发现:Early Fusion with Low Vision Ratio

策略Vision Injection TimingVision-Text Ratio效果
Early (Best)0% (从头开始)10%:90%Vision Knowledge25.8, Vision Reasoning 43.8, Text Knowledge 65.7
Mid50%20%:80%各项均低于Early
Late (传统做法)80%50%:50%最差

结论:固定总vision-text token budget下,early fusion with lower vision ratio优于late injection with high ratio。传统”后期大量加视觉”的做法不如”从头少量混入”。

训练数据

项目详情
总量~15T mixed visual+text tokens
Pre-training内容Text+Knowledge, Alt-text, Synthesis Caption, Grounding, OCR, Video, OS Screenshot
Mid-trainingHigh-quality Text & Multimodal, Long Text, Long Video, Reasoning, Long-CoT
序列长度Pre-training 4096 → Mid-training 32K→262K

Infra设计

项目详情
继承Kimi K2 infra (minimal modifications)
新增Decoupled Encoder Process (DEP):vision encoder融入existing pipeline with negligible additional overhead

2. 后训练 Recipe

关键设计:Zero-Vision SFT(核心创新)

问题:预训练VLM不会自然做vision-based tool-calling(多模态RL的cold-start problem)

传统做法:用人工标注或prompt-engineered CoT数据(多样性有限,仅简单diagram+primitive tool manipulation)

K2.5做法(Zero-Vision SFT):

  • 仅用text SFT数据即可激活视觉+agentic能力
  • 所有图像操作通过IPython中的programmatic operations代理执行
  • 作为传统vision tool-use的泛化
  • 能激活diverse reasoning behaviors:pixel-level操作(二值化+计数估算物体大小)、object localization、counting、OCR等

为什么有效:joint pretraining已建立strong vision-text alignment,能力可自然跨模态泛化

关键发现:添加human-designed visual trajectories在这个阶段反而损害泛化,text-only SFT效果更好

Joint Text-Vision RL

项目详情
方法同时在text和vision tasks上做RL
关键发现VisualRL增强textual performance而非损害(MMLU-Pro/GPQA-Diamond提升)
双向增强text bootstraps vision → vision refines text

Toggle:Reasoning长度控制

问题:rigid budget constraints下训练的模型无法泛化到更高compute scales

Toggle方法:交替两个phase(每m iterations切换一次):

  • Phase 0(budget limited):模型需在task-dependent token budget内解题。仅在mean accuracy超过阈值λ时才enforce budget constraint
  • Phase 1 (standard scaling):生成到max token limit,鼓励leverage computation

Budget估算:correct responses中第ρ百分位的token长度,训练开始时估算一次后固定

效果:平均减少25-30% output tokens,performance几乎不降,冗余patterns(重复验证、机械计算)大幅减少。具备domain generalization:仅在math/code上训练也能泛化到GPQA/MMLU-Pro


3. Agent Swarm(Parallel Agent Orchestration)

PARL (Parallel-Agent Reinforcement Learning)

项目详情
架构Decoupled: trainable orchestrator + frozen sub-agents
Orchestrator训练通过RL优化,拥有sub-agent creation和task delegation接口
Sub-agents冻结,其execution trajectories排除在optimization objective之外
设计优势规避end-to-end co-optimization的两大挑战:credit assignment ambiguity + training instability
执行模式动态分解complex tasks为heterogeneous sub-problems并行执行
效果Wide-search场景latency降低4.5×,item-level F1从72.8%提升到79.0%

4. 关键亮点

  1. Zero-Vision SFT:仅用text SFT数据激活视觉agentic能力(IPython代理图像操作),human-annotated visual data反而有害
  2. Early Fusion > Late Injection:固定budget下从头少量混入vision优于后期大量注入(颠覆传统做法)
  3. Bidirectional Cross-Modal Enhancement:visualRL提升text performance,text bootstraps vision
  4. Agent Swarm + PARL:orchestrator-onlyRL + frozen sub-agents并行执行,4.5× latency reduction
  5. Toggle:交替budget-limited和standard scaling,25-30% token reduction with negligible quality loss
  6. MoonViT-3D:native-resolution +4帧temporal averaging,4x更长视频处理
  7. Decoupled Encoder Process:vision encoder融入pipeline parallelism with negligible overhead
本文结束 感谢您的阅读