标签: LLM
所有带有"LLM"标签的文章。
-
交叉熵:为什么预测让 AI 变聪明?
发布于:从信息论出发解释交叉熵:为什么“预测下一个词”能让 AI 变聪明?本文串起熵、交叉熵与 KL 散度的关系,说明大模型训练的本质就是让模型的世界观不断逼近真实世界的概率分布。
-
从熵到大模型:为什么“预测”就是一种压缩?
发布于:从 Shannon 熵出发,理解“预测就是压缩”这一核心思想:信息来自不可预测性,机器学习就是减少不可预测性,而大模型本质上是在寻找人类知识的最简洁表达。
-
学习笔记:上下文工程 (Context Engineering) —— AI Agent 背后的关键技术
发布于:上下文工程为什么成为 AI Agent 时代的关键能力?本文整理自一堂公开课的学习笔记:从 Prompt Engineering 的演进说起,梳理完整 Context 的七大构成要素,详解选择、压缩、Multi-Agent 三大核心招式,并动手拆解工具调用与 Computer Use 的执行机制。
-
学习笔记:解剖大型语言模型 (Dissecting Large Language Models)
发布于:整理自生成式 AI 公开课的学习笔记:从 Token ID 到 Logits 的宏观计算流讲起,拆解隐藏表征分析与 Logit Lens、Self-Attention 机制、FFN 记忆网络与位置编码,并用 Colab 实作解剖 LLaMA-3.2 与 Gemma-2。