跳到正文
孔明の博客

AI 大模型研发与应用


  • Home

  • Archives

  • Search

Nex-N2 技术报告摘要:面向智能体的 Agentic Thinking 框架

Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 363 | 1 分钟
梳理 Nex-AGI 的 Nex-N2 模型:在 Qwen3.5 基座上做后训练,核心是统一自适应思维与连贯思维的 Agentic Thinking 框架,并说明当前公开材料尚未披露训练方法、数据配比与 RL 算法等细节这一局限。
Read more »

NVIDIA Nemotron 3 白皮书解读:混合 Mamba-Transformer MoE 家族

Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 634 | 2 分钟
梳理 NVIDIA Nemotron 3 白皮书:由三个模型组成的混合 Mamba-Transformer MoE 家族、在隐空间做路由以兼顾延迟与吞吐的 LatentMoE 核心技术,以及多环境强化学习等预训练与后训练设计。
Read more »

Nemotron 3 Ultra 技术报告解读:550B 规模的 NVFP4 预训练与多教师蒸馏

Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 803 | 3 分钟
解读 NVIDIA Nemotron 3 Ultra:用 550B 参数与 20T token 验证 NVFP4 在极限规模下的训练稳定性,并通过多教师在线策略蒸馏 MOPD 把多个专用教师模型的能力压缩进单一学生模型。
Read more »

Nemotron 3 Super 技术报告解读:LatentMoE 与 NVFP4 预训练

Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 816 | 3 分钟
解读 NVIDIA Nemotron 3 Super 的三大技术点:在隐空间做专家路由、同时优化精度与 FLOPs 的 LatentMoE,首次大规模稳定训练到 25T token 的 NVFP4 预训练,以及以 Mamba-2 为主的混合 Mamba-Attention 加 MoE 架构。
Read more »

MiniMax-M2 技术报告解读:细粒度专家与 Sigmoid 门控 MoE

Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 1k | 4 分钟
解读 MiniMax-M2 的 MoE 架构创新:用 256 个细粒度专家替代少量大专家以增加路由组合多样性、用相互独立的 Sigmoid 门控取代 softmax top-k 竞争,并梳理其面向智能体编码的后训练数据方案。
Read more »

MiniMax-M1 技术报告解读:Lightning Attention 与高效测试时扩展

Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 863 | 3 分钟
解读 MiniMax-M1 如何用 Lightning Attention 支撑超长上下文下的测试时计算扩展,并重点分析混合架构特有的训练与推理精度不匹配问题:把 LM 输出头提升到高精度后,强化学习的 reward 才能正常增长。
Read more »

MiMo-VL 技术报告解读:混合在线强化学习的多模态推理模型

Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 810 | 3 分钟
解读小米 MiMo-VL 的训练思路:预训练中期就引入长思维链推理数据、后训练跳过独立 SFT 直接进入强化学习,并用统一 RLVR 与 RLHF 的混合在线强化学习框架 MORL 让 7B 模型超越 72B 级多模态模型。
Read more »

MiMo-V2-Flash 技术报告解读:混合滑窗注意力与多教师在线蒸馏

Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 742 | 3 分钟
解读小米 MiMo-V2-Flash 的关键设计:滑窗注意力配合 Attention Sink 偏置的混合架构在推理与长上下文上更优且 KV 缓存减少 6 倍、多教师在线策略蒸馏 MOPD,以及解决 MoE 路由不一致的 Rollout Routing Replay。
Read more »

MiMo-7B 技术报告解读:为推理能力而生的预训练与后训练

Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 905 | 3 分钟
解读小米 MiMo-7B 如何让 7B 基座模型的推理潜力超越 32B 模型:从预训练阶段的数据质量与配比策略、兼顾性能与推理加速的 MTP,到借鉴竞赛评分机制缓解代码任务稀疏奖励的 Test Difficulty Driven Reward 与高效 rollout 引擎。
Read more »

LongCat-Flash 技术报告解读:零计算专家与 Shortcut 连接 MoE

Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 589 | 2 分钟
解读美团 LongCat-Flash 的高效 MoE 设计:按 token 动态分配计算预算的零计算专家、重叠通信与计算的 Shortcut-Connected MoE,以及支撑 30 天完成 20T token 训练的训练管线与 PID 负载均衡控制器。
Read more »

LongCat-Flash-Thinking 技术报告解读:领域并行强化学习与 DORA 异步框架

Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 537 | 2 分钟
解读美团 LongCat-Flash-Thinking 的推理能力训练方案:把 STEM、代码与智能体领域拆开并行做强化学习再融合为帕累托最优模型,并用工业级异步 rollout 框架 DORA 取得三倍以上的训练加速。
Read more »

LongCat-2.0 技术报告解读:稀疏注意力与 N-Gram 嵌入扩参

Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 650 | 2 分钟
解读美团 LongCat-2.0 的三大设计:从三个正交方向改进 DSA 的 LongCat 稀疏注意力、用 N-gram 嵌入在 MoE 之外开辟正交扩参维度以突破稀疏化收益递减,以及在非 GPU 的 ASIC 平台上完成 35T token 预训练的工程实践。
Read more »
123…16
戈孔明

戈孔明

185 posts
50 categories
736 tags
GitHub E-Mail
我的平台
  • 个人博客
  • 知识库
© 2020 — 2026 戈孔明 | 531.7k 赣ICP备20004005号
0%