标签: RL
所有带有"RL"标签的文章。
-
强化学习基础:从 MDP、Bellman 方程到 Monte Carlo、TD 与 Q-Learning
发布于:整理自 B 站「大白话 03」视频,补充大量例子(含《原神》场景):从强化学习的试错本质、MDP 框架,到 Return 与折扣因子、V/Q 价值函数、Bellman 方程,再到 Monte Carlo、TD、SARSA、Q-Learning、DQN 与 Policy-based 路线,用连贯的章节把整个 RL 基础串起来。
所有带有"RL"标签的文章。
整理自 B 站「大白话 03」视频,补充大量例子(含《原神》场景):从强化学习的试错本质、MDP 框架,到 Return 与折扣因子、V/Q 价值函数、Bellman 方程,再到 Monte Carlo、TD、SARSA、Q-Learning、DQN 与 Policy-based 路线,用连贯的章节把整个 RL 基础串起来。