标签: Self-Attention
所有带有"Self-Attention"标签的文章。
-
学习笔记:解剖大型语言模型 (Dissecting Large Language Models)
发布于:整理自生成式 AI 公开课的学习笔记:从 Token ID 到 Logits 的宏观计算流讲起,拆解隐藏表征分析与 Logit Lens、Self-Attention 机制、FFN 记忆网络与位置编码,并用 Colab 实作解剖 LLaMA-3.2 与 Gemma-2。
所有带有"Self-Attention"标签的文章。
整理自生成式 AI 公开课的学习笔记:从 Token ID 到 Logits 的宏观计算流讲起,拆解隐藏表征分析与 Logit Lens、Self-Attention 机制、FFN 记忆网络与位置编码,并用 Colab 实作解剖 LLaMA-3.2 与 Gemma-2。