分类: 深度学习
所有属于"深度学习"分类的文章。
-
Vision Transformer(ViT):当 Transformer 开始「看」图片
发布于:整理自 B 站《15分钟认识ViT》等视频与知乎资料:从「图片能不能变成 Token」出发,串讲 Patch、Patch Embedding、CLS、位置编码与 Transformer Encoder 的完整流程,对比 CNN 的归纳偏置,并给出 DeiT、Swin 等改进路线。
-
持续学习 Continual Learning:如何让模型学习新知识,却不忘记过去?
发布于:系统整理持续学习(Continual Learning)主线:从灾难性遗忘出发,串起 EWC、Replay、知识蒸馏、GEM、动态架构五条经典路线,再延伸到 Online、Open-World、PEFT、VLM、LLM 与 Lifelong Agent 等现代方向。
-
知识蒸馏:为什么“小模型”可以向“大模型”学习?
发布于:从 Hinton 的经典 KD 讲起,拆解教师-学生框架、温度软化、Soft/Hard 双损失,梳理响应/特征/关系三类蒸馏的演进,并延伸到自蒸馏与大模型时代,最后用信息论视角统一蒸馏本质。
-
KL散度:信息论视角下概率分布对齐工具,原理、辨析与论文实战
发布于:从数学定义与关键特性出发,对比 KL 散度与余弦相似度的差异,结合 CDSD、TimeDistill 两篇论文讲解工程落地,并给出实践避坑要点与参考资料。