标签: 学习笔记
所有带有"学习笔记"标签的文章。
-
Vision Transformer(ViT):当 Transformer 开始「看」图片
发布于:整理自 B 站《15分钟认识ViT》等视频与知乎资料:从「图片能不能变成 Token」出发,串讲 Patch、Patch Embedding、CLS、位置编码与 Transformer Encoder 的完整流程,对比 CNN 的归纳偏置,并给出 DeiT、Swin 等改进路线。
-
从 PPO 到 DPO、GRPO:大模型强化学习到底在优化什么?
发布于:整理自 B 站「大白话04」视频并补充 DPO 内容:从 Policy Gradient 与 Advantage 讲起,用直观例子拆解 PPO 的 Clip 与 GAE、DPO 的直接偏好优化,以及 GRPO 如何用组内相对 Advantage 省掉 Critic,串起大模型后训练的三种主流强化学习方法。
-
持续学习 Continual Learning:如何让模型学习新知识,却不忘记过去?
发布于:系统整理持续学习(Continual Learning)主线:从灾难性遗忘出发,串起 EWC、Replay、知识蒸馏、GEM、动态架构五条经典路线,再延伸到 Online、Open-World、PEFT、VLM、LLM 与 Lifelong Agent 等现代方向。
-
强化学习基础:从 MDP、Bellman 方程到 Monte Carlo、TD 与 Q-Learning
发布于:整理自 B 站「大白话 03」视频,补充大量例子(含《原神》场景):从强化学习的试错本质、MDP 框架,到 Return 与折扣因子、V/Q 价值函数、Bellman 方程,再到 Monte Carlo、TD、SARSA、Q-Learning、DQN 与 Policy-based 路线,用连贯的章节把整个 RL 基础串起来。