跳到正文
孔明の博客

AI 大模型研发与应用


  • Home

  • Archives

  • Search

奖励模型Tag

08-04

Seed1.5-VL 技术报告解读:原生分辨率视觉与混合可验证奖励强化学习

08-04

Seed1.5-Thinking 技术报告解读:VAPO 与 DAPO 强化学习训练推理模型

04-28

人类对齐与强化学习—RLHF 核心问题梳理与实践难点

06-02

人类对齐与强化学习—DPO 直接偏好优化原理详解

戈孔明

戈孔明

185 posts
50 categories
736 tags
GitHub E-Mail
我的平台
  • 个人博客
  • 知识库
© 2020 — 2026 戈孔明 | 531.6k 赣ICP备20004005号
0%