文章
我发布的所有文章。
-
持续学习 Continual Learning:如何让模型学习新知识,却不忘记过去?
发布于:系统整理持续学习(Continual Learning)主线:从灾难性遗忘出发,串起 EWC、Replay、知识蒸馏、GEM、动态架构五条经典路线,再延伸到 Online、Open-World、PEFT、VLM、LLM 与 Lifelong Agent 等现代方向。
-
强化学习基础:从 MDP、Bellman 方程到 Monte Carlo、TD 与 Q-Learning
发布于:整理自 B 站「大白话 03」视频,补充大量例子(含《原神》场景):从强化学习的试错本质、MDP 框架,到 Return 与折扣因子、V/Q 价值函数、Bellman 方程,再到 Monte Carlo、TD、SARSA、Q-Learning、DQN 与 Policy-based 路线,用连贯的章节把整个 RL 基础串起来。
-
傅里叶变换,不过就是换了一个坐标系
发布于:从线性代数视角重新理解傅里叶变换:它就是一次坐标分解——把函数从时间基底重新表示到频率基底,并延伸到傅里叶级数、DFT 与 FFT 的统一视角。
-
知识蒸馏:为什么“小模型”可以向“大模型”学习?
发布于:从 Hinton 的经典 KD 讲起,拆解教师-学生框架、温度软化、Soft/Hard 双损失,梳理响应/特征/关系三类蒸馏的演进,并延伸到自蒸馏与大模型时代,最后用信息论视角统一蒸馏本质。