分类: 强化学习
所有属于"强化学习"分类的文章。
-
从 PPO 到 DPO、GRPO:大模型强化学习到底在优化什么?
发布于:整理自 B 站「大白话04」视频并补充 DPO 内容:从 Policy Gradient 与 Advantage 讲起,用直观例子拆解 PPO 的 Clip 与 GAE、DPO 的直接偏好优化,以及 GRPO 如何用组内相对 Advantage 省掉 Critic,串起大模型后训练的三种主流强化学习方法。
-
强化学习基础:从 MDP、Bellman 方程到 Monte Carlo、TD 与 Q-Learning
发布于:整理自 B 站「大白话 03」视频,补充大量例子(含《原神》场景):从强化学习的试错本质、MDP 框架,到 Return 与折扣因子、V/Q 价值函数、Bellman 方程,再到 Monte Carlo、TD、SARSA、Q-Learning、DQN 与 Policy-based 路线,用连贯的章节把整个 RL 基础串起来。