跳到正文
孔明の博客

AI 大模型研发与应用


  • Home

  • Archives

  • Search

强化学习Tag

08-04

开源大模型技术演进时间线:预训练、后训练与强化学习

08-04

Seed1.5-Thinking 技术报告解读:VAPO 与 DAPO 强化学习训练推理模型

08-04

Phi-4-Reasoning 技术报告解读:可教学数据过滤与推理能力训练

08-04

Nemotron 3 Ultra 技术报告解读:550B 规模的 NVFP4 预训练与多教师蒸馏

08-04

MiniMax-M1 技术报告解读:Lightning Attention 与高效测试时扩展

08-04

MiMo-7B 技术报告解读:为推理能力而生的预训练与后训练

08-04

LongCat-Flash-Thinking 技术报告解读:领域并行强化学习与 DORA 异步框架

08-04

InternVL3.5 技术报告解读:Cascade RL 与动态视觉分辨率路由

08-04

Inkling 技术报告解读:Thinking Machines Lab 的 975B 开源 MoE 模型

08-15

人类对齐与强化学习—On-Policy 与 Off-Policy 深度辨析

04-28

人类对齐与强化学习—RLHF 核心问题梳理与实践难点

04-07

人类对齐与强化学习—RLHF 全流程与 PPO 原理源码解读

12
戈孔明

戈孔明

185 posts
50 categories
736 tags
GitHub E-Mail
我的平台
  • 个人博客
  • 知识库
© 2020 — 2026 戈孔明 | 531.6k 赣ICP备20004005号
0%