从基本定义、原理区别、数学表达、实例类比到矛盾分析,逐层辨析强化学习中 on-policy 与 off-policy 两种学习策略的本质差异:训练所使用的数据究竟来自当前策略还是其他策略。
https://mp.weixin.qq.com/s/am_ulGA18klm6T5KEuAI7w
在强化学习(Reinforcement Learning,RL)中,on-policy 和 off-policy 是两种核心的学习策略,它们之间的区别在于:
学习使用的数据是否来自当前策略本身,还是来自其他策略。
要想真正理解这两个概念,我们不仅要从算法原理入手,还要把握其本质。下面我将从基本定义 → 原理区别 → 数学表达 → 实例类比 → 矛盾分析几个层次进行深入剖析。

