标签: PPO
所有带有"PPO"标签的文章。
-
从 PPO 到 DPO、GRPO:大模型强化学习到底在优化什么?
发布于:整理自 B 站「大白话04」视频并补充 DPO 内容:从 Policy Gradient 与 Advantage 讲起,用直观例子拆解 PPO 的 Clip 与 GAE、DPO 的直接偏好优化,以及 GRPO 如何用组内相对 Advantage 省掉 Critic,串起大模型后训练的三种主流强化学习方法。
所有带有"PPO"标签的文章。
整理自 B 站「大白话04」视频并补充 DPO 内容:从 Policy Gradient 与 Advantage 讲起,用直观例子拆解 PPO 的 Clip 与 GAE、DPO 的直接偏好优化,以及 GRPO 如何用组内相对 Advantage 省掉 Critic,串起大模型后训练的三种主流强化学习方法。