文章
我发布的所有文章。
-
从梯度下降到 Adam:神经网络优化器是如何一步步演化的?
发布于:整理自王木头学科学讲解梯度下降优化的视频:沿着「每个方法解决前一个方法的问题」的主线,从梯度下降、SGD 讲到 Momentum、Nesterov、AdaGrad、RMSProp,再到 Adam 与 AdamW,并解释为什么深度学习不用牛顿法。
-
迁移学习(Transfer Learning):把已经学会的知识迁移到新任务
发布于:系统整理迁移学习(Transfer Learning)主线:从「旧知识能不能帮到新任务」出发,讲清 Pretraining + Fine-tuning 范式、Inductive / Transductive / Unsupervised 三种类型、Domain Shift 与 Domain Adaptation,再到各领域的应用、Negative Transfer 与现代 Foundation Model 适配。
-
Vision Transformer(ViT):当 Transformer 开始「看」图片
发布于:整理自 B 站《15分钟认识ViT》等视频与知乎资料:从「图片能不能变成 Token」出发,串讲 Patch、Patch Embedding、CLS、位置编码与 Transformer Encoder 的完整流程,对比 CNN 的归纳偏置,并给出 DeiT、Swin 等改进路线。
-
从 PPO 到 DPO、GRPO:大模型强化学习到底在优化什么?
发布于:整理自 B 站「大白话04」视频并补充 DPO 内容:从 Policy Gradient 与 Advantage 讲起,用直观例子拆解 PPO 的 Clip 与 GAE、DPO 的直接偏好优化,以及 GRPO 如何用组内相对 Advantage 省掉 Critic,串起大模型后训练的三种主流强化学习方法。