标签: 强化学习
所有带有"强化学习"标签的文章。
-
从 PPO 到 DPO、GRPO:大模型强化学习到底在优化什么?
发布于:整理自 B 站「大白话04」视频并补充 DPO 内容:从 Policy Gradient 与 Advantage 讲起,用直观例子拆解 PPO 的 Clip 与 GAE、DPO 的直接偏好优化,以及 GRPO 如何用组内相对 Advantage 省掉 Critic,串起大模型后训练的三种主流强化学习方法。
-
强化学习基础:从 MDP、Bellman 方程到 Monte Carlo、TD 与 Q-Learning
发布于:整理自 B 站「大白话 03」视频,补充大量例子(含《原神》场景):从强化学习的试错本质、MDP 框架,到 Return 与折扣因子、V/Q 价值函数、Bellman 方程,再到 Monte Carlo、TD、SARSA、Q-Learning、DQN 与 Policy-based 路线,用连贯的章节把整个 RL 基础串起来。
-
学习笔记:DeepSeek-R1 等推理大模型是如何进行“深度思考”(Reasoning)的?
发布于:DeepSeek-R1 等推理大模型是如何进行「深度思考」的?本文整理自一堂公开课的学习笔记:从 Test-Time Compute 的本质讲起,梳理打造推理能力的四大技术路径(提示词 CoT、搜索工作流、模仿学习、结果导向强化学习),并深入解密 R1 的完整训练链路与过度思考的挑战。