跳到正文
孔明の博客
AI 大模型研发与应用
Home
Archives
Search
输入搜索关键词
奖励模型
Tag
08-04
Seed1.5-VL 技术报告解读:原生分辨率视觉与混合可验证奖励强化学习
08-04
Seed1.5-Thinking 技术报告解读:VAPO 与 DAPO 强化学习训练推理模型
04-28
人类对齐与强化学习—RLHF 核心问题梳理与实践难点
06-02
人类对齐与强化学习—DPO 直接偏好优化原理详解
0
%