解读 Kimi-K2.5 面向视觉智能体的两项关键设计:固定视觉文本 token 预算下早期融合优于后期大量注入视觉这一预训练发现,以及解决多模态工具调用冷启动问题的 Zero-Vision SFT 方案。
Kimi-K2.5 技术报告摘要
论文:Kimi K2.5: Visual Agentic Intelligence
团队:Kimi Team (Moonshot AI)
时间:2026.03(arXiv:2602.02276)
页数:30页
1. 预训练 Recipe(Native Multimodal Pre-Training)
训练策略
| 项目 | 详情 |
|---|---|
| 基座 | Kimi K2 (1T MoE, 32B activated) |
| 方法 | 在K2基础上做大规模joint pre-training,约15T mixed visual+text tokens |
| Vision Encoder | MoonViT-3D:native-resolution encoder + NaViT packing strategy,支持variable-resolution image输入 |
| Video处理 | 轻量3D ViT compression:每4帧为一组,共享MoonViT encoder,patch级temporal averaging → 可处理4x更长的视频 |
| Image/Video encoder | 完全weight sharing |
关键发现:Early Fusion with Low Vision Ratio
| 策略 | Vision Injection Timing | Vision-Text Ratio | 效果 |
|---|---|---|---|
| Early (Best) | 0% (从头开始) | 10%:90% | Vision Knowledge25.8, Vision Reasoning 43.8, Text Knowledge 65.7 |
| Mid | 50% | 20%:80% | 各项均低于Early |
| Late (传统做法) | 80% | 50%:50% | 最差 |
结论:固定总vision-text token budget下,early fusion with lower vision ratio优于late injection with high ratio。传统”后期大量加视觉”的做法不如”从头少量混入”。
训练数据
| 项目 | 详情 |
|---|---|
| 总量 | ~15T mixed visual+text tokens |
| Pre-training内容 | Text+Knowledge, Alt-text, Synthesis Caption, Grounding, OCR, Video, OS Screenshot |
| Mid-training | High-quality Text & Multimodal, Long Text, Long Video, Reasoning, Long-CoT |
| 序列长度 | Pre-training 4096 → Mid-training 32K→262K |
Infra设计
| 项目 | 详情 |
|---|---|
| 继承 | Kimi K2 infra (minimal modifications) |
| 新增 | Decoupled Encoder Process (DEP):vision encoder融入existing pipeline with negligible additional overhead |
2. 后训练 Recipe
关键设计:Zero-Vision SFT(核心创新)
问题:预训练VLM不会自然做vision-based tool-calling(多模态RL的cold-start problem)
传统做法:用人工标注或prompt-engineered CoT数据(多样性有限,仅简单diagram+primitive tool manipulation)
K2.5做法(Zero-Vision SFT):
- 仅用text SFT数据即可激活视觉+agentic能力
- 所有图像操作通过IPython中的programmatic operations代理执行
- 作为传统vision tool-use的泛化
- 能激活diverse reasoning behaviors:pixel-level操作(二值化+计数估算物体大小)、object localization、counting、OCR等
为什么有效:joint pretraining已建立strong vision-text alignment,能力可自然跨模态泛化
关键发现:添加human-designed visual trajectories在这个阶段反而损害泛化,text-only SFT效果更好
Joint Text-Vision RL
| 项目 | 详情 |
|---|---|
| 方法 | 同时在text和vision tasks上做RL |
| 关键发现 | VisualRL增强textual performance而非损害(MMLU-Pro/GPQA-Diamond提升) |
| 双向增强 | text bootstraps vision → vision refines text |
Toggle:Reasoning长度控制
问题:rigid budget constraints下训练的模型无法泛化到更高compute scales
Toggle方法:交替两个phase(每m iterations切换一次):
- Phase 0(budget limited):模型需在task-dependent token budget内解题。仅在mean accuracy超过阈值λ时才enforce budget constraint
- Phase 1 (standard scaling):生成到max token limit,鼓励leverage computation
Budget估算:correct responses中第ρ百分位的token长度,训练开始时估算一次后固定
效果:平均减少25-30% output tokens,performance几乎不降,冗余patterns(重复验证、机械计算)大幅减少。具备domain generalization:仅在math/code上训练也能泛化到GPQA/MMLU-Pro
3. Agent Swarm(Parallel Agent Orchestration)
PARL (Parallel-Agent Reinforcement Learning)
| 项目 | 详情 |
|---|---|
| 架构 | Decoupled: trainable orchestrator + frozen sub-agents |
| Orchestrator训练 | 通过RL优化,拥有sub-agent creation和task delegation接口 |
| Sub-agents | 冻结,其execution trajectories排除在optimization objective之外 |
| 设计优势 | 规避end-to-end co-optimization的两大挑战:credit assignment ambiguity + training instability |
| 执行模式 | 动态分解complex tasks为heterogeneous sub-problems并行执行 |
| 效果 | Wide-search场景latency降低4.5×,item-level F1从72.8%提升到79.0% |
4. 关键亮点
- Zero-Vision SFT:仅用text SFT数据激活视觉agentic能力(IPython代理图像操作),human-annotated visual data反而有害
- Early Fusion > Late Injection:固定budget下从头少量混入vision优于后期大量注入(颠覆传统做法)
- Bidirectional Cross-Modal Enhancement:visualRL提升text performance,text bootstraps vision
- Agent Swarm + PARL:orchestrator-onlyRL + frozen sub-agents并行执行,4.5× latency reduction
- Toggle:交替budget-limited和standard scaling,25-30% token reduction with negligible quality loss
- MoonViT-3D:native-resolution +4帧temporal averaging,4x更长视频处理
- Decoupled Encoder Process:vision encoder融入pipeline parallelism with negligible overhead

