LongCat-Flash-Thinking 技术报告解读:领域并行强化学习与 DORA 异步框架

解读美团 LongCat-Flash-Thinking 的推理能力训练方案:把 STEM、代码与智能体领域拆开并行做强化学习再融合为帕累托最优模型,并用工业级异步 rollout 框架 DORA 取得三倍以上的训练加速。

LongCat-Flash-Thinking —技术报告摘要

论文:Introducing LongCat-Flash-Thinking: A Technical Report (arXiv:2509.18883)
团队:Meituan LongCat Team
发布时间:2025.09
页数:24页


1. 预训练 Recipe

训练策略

项目详情
基座LongCat-Flash-Base(560B MoE)
Mid-training在base上注入reasoning-intensive data(数学/物理/化学竞赛题 + 算法编程题),调整data mixing ratio保持通用能力
关键发现Reasoning-intensive data比例越高,pass@1pass@128全面提升(AIME-24 +27.7%,LCB +6.5%)
数据质量Hybrid heuristic rules + LLM-as-a-Judge过滤/去重/去污染

2. 后训练 Recipe (SFT)

Reasoning-Oriented SFT

项目详情
目标对齐instruction-following +增强specialized reasoning capabilities
作为cold-start为后续RL提供基础policy
数据Reasoning-intensive + agentic data

3.RL Recipe

训练策略

项目详情
核心PipelineMid-training → Reasoning-Oriented SFT → Domain-Parallel RL → Expert Fusion → General RL
算法改进的GRPO,适配异步RL训练的稳定性
核心创新: Domain-Parallel Training解耦多域优化:同时训练STEM Expert / Code Expert / Agentic Expert(各自独立RL),然后fuse为单一near Pareto-optimal model
Domain类别STEM RL、Code RL、Agentic RL、General RL
Fusion后General RL stage进一步refine:robustness, safety, human alignment
解决的问题传统mixed-domain RL不稳定;domain-parallel解耦后稳定性显著提升

DORA (Dynamic Orchestration for Asynchronous Rollout)

项目详情
核心Industrial-scale异步RL框架
加速>3× speedup vs synchronous frameworks
规模Tens of thousands of accelerators
特点支持massive RL investment稳定运行

###效率亮点

项目详情
Token效率AIME-25平均token消耗从19,653降至6,965(-64.5%),准确率不降
意义高效agentic reasoning:更少思考步骤达到同等效果

4. 关键亮点

  1. Domain-Parallel RL Training + Fusion:STEM/Code/Agentic独立训练→fusion为Pareto-optimal模型,解决mixed-domain RL不稳定
  2. DORA:Industrial-scale异步RL框架,>3×加速,万卡级训练
  3. Mid-training Reasoning Enhancement:预训练后注入竞赛题数据显著提升reasoning boundary
  4. Token效率提升64.5%:减少思考长度同时维持accuracy
  5. Open-source reasoning model SOTA:超DeepSeek-V3.2-Thinking, Qwen3.5-Thinking等
本文结束 感谢您的阅读