分类: 深度学习
所有属于"深度学习"分类的文章。
-
信息压缩与信息瓶颈:从“文件变小”到“表示变干净”
发布于:从熵和互信息出发,讲清楚表示层面的信息压缩与信息瓶颈(IB):压缩不是把数据变小,而是让模型的表示更干净——只保留任务相关信息。并落到 CIBM、Cauvis、蒸馏与单域泛化课题上。
-
LoRA 是什么?大模型微调到底是在“调”什么?
发布于:整理自《什么是 LoRA 大模型微调是怎么回事》视频:从「微调到底在改什么」出发,讲清 ΔW 的低秩假设、BA 分解、A/B 初始化与 α/r 缩放,再理清 LoRA 与 Adapter、SFT、QLoRA 的关系及局限。
-
从梯度下降到 Adam:神经网络优化器是如何一步步演化的?
发布于:整理自王木头学科学讲解梯度下降优化的视频:沿着「每个方法解决前一个方法的问题」的主线,从梯度下降、SGD 讲到 Momentum、Nesterov、AdaGrad、RMSProp,再到 Adam 与 AdamW,并解释为什么深度学习不用牛顿法。
-
迁移学习(Transfer Learning):把已经学会的知识迁移到新任务
发布于:系统整理迁移学习(Transfer Learning)主线:从「旧知识能不能帮到新任务」出发,讲清 Pretraining + Fine-tuning 范式、Inductive / Transductive / Unsupervised 三种类型、Domain Shift 与 Domain Adaptation,再到各领域的应用、Negative Transfer 与现代 Foundation Model 适配。