跳到正文
孔明の博客
AI 大模型研发与应用
Home
Archives
Search
输入搜索关键词
强化学习
Tag
08-04
开源大模型技术演进时间线:预训练、后训练与强化学习
08-04
Seed1.5-Thinking 技术报告解读:VAPO 与 DAPO 强化学习训练推理模型
08-04
Phi-4-Reasoning 技术报告解读:可教学数据过滤与推理能力训练
08-04
Nemotron 3 Ultra 技术报告解读:550B 规模的 NVFP4 预训练与多教师蒸馏
08-04
MiniMax-M1 技术报告解读:Lightning Attention 与高效测试时扩展
08-04
MiMo-7B 技术报告解读:为推理能力而生的预训练与后训练
08-04
LongCat-Flash-Thinking 技术报告解读:领域并行强化学习与 DORA 异步框架
08-04
InternVL3.5 技术报告解读:Cascade RL 与动态视觉分辨率路由
08-04
Inkling 技术报告解读:Thinking Machines Lab 的 975B 开源 MoE 模型
08-15
人类对齐与强化学习—On-Policy 与 Off-Policy 深度辨析
04-28
人类对齐与强化学习—RLHF 核心问题梳理与实践难点
04-07
人类对齐与强化学习—RLHF 全流程与 PPO 原理源码解读
1
2
0
%