大语言模型的训练,本质上是在学习一个更接近真实世界的概率分布。
而交叉熵,就是衡量“模型理解世界还有多少差距”的工具。
现代人工智能,尤其是 GPT 类大语言模型,训练目标看起来非常简单:给定前面的文本,预测下一个 token。
例如输入 “The capital of France is”,模型预测 “Paris”,然后计算预测是否正确。
很多人认为:GPT 不就是在做文本预测吗?
但真正的问题是:
为什么预测任务可以产生智能?为什么一个简单的预测目标能够让模型学会语言、知识甚至推理?
答案需要从信息论开始。
1. 信息到底是什么?
1948 年,Claude Shannon 提出了信息论。其中一个核心思想:
信息来自不确定性的减少。
假设有人告诉你“今天太阳升起”——你不会觉得有什么信息,因为这个事件太容易预测。但如果他说“明天太阳消失”,你会非常震惊,因为这个事件概率极低。
表示一个事件包含的信息量。规律:
- 越常见 → 信息越少
- 越罕见 → 信息越多
2. 熵:世界本身有多少不确定性?
如果我们考虑一个随机系统,例如天气:晴天 50%、雨天 50%——我们无法提前知道结果,那么这个系统具有较高的不确定性。
Shannon 定义:
称为 Entropy(熵)。它表示:
如果完全知道这个世界的规律,描述它最少需要多少信息。
举两个极端:
情况 1:完全确定(太阳每天升起概率 = 100%)——没有未知:
情况 2:完全随机(正面 50%、反面 50%)——无法预测:熵最大。
所以:熵衡量的是世界本身的复杂程度。
3. 压缩为什么和预测有关?
假设我要保存一句话:
The cat is sitting on the mat
最简单的方法是保存每个字符:T h e c a t …
但是如果机器理解英语规律,看到 “The cat is sitting on the”,它知道 “mat” 的概率很高——那么 “mat” 就不需要完整保存。这就是压缩。
因此:
压缩不是删除信息,而是删除已经可以预测的信息。
一个更强的预测模型,意味着更短的信息表示。所以:预测能力↑ 意味着 压缩能力↑。
4. GPT 为什么预测下一个 Token?
GPT 的训练过程:输入 “The cat sat on the”,输出概率:
mat 0.7
floor 0.2
chair 0.05
...
模型不是直接输出答案,而是产生一个概率分布——也就是模型认为“下一步可能是什么”。
训练的目标:让这个概率分布越来越接近真实语言规律。这就是 Cross Entropy(交叉熵)。
5. 什么是交叉熵?
假设真实世界概率为 ,模型预测概率为 。
例如真实分布:“Paris = 100%”。
模型 A:Paris 0.9 / London 0.1——模型还是比较理解。
模型 B:Paris 0.001 / London 0.999——虽然最后可能猜对一次,但它实际上“不相信正确答案”。
因此我们需要衡量:**如果模型使用自己的概率分布描述真实世界,需要多少信息?**这就是交叉熵:
6. 为什么交叉熵是训练 AI 的核心?
对于分类任务,真实标签是“猫”:
模型输出“猫 0.99 / 狗 0.01” → Loss ,很小。
模型输出“猫 0.01 / 狗 0.99” → Loss ,巨大。
所以:
交叉熵惩罚的不是“你有没有猜错”,而是“你对于正确答案到底有多不确定”。
7. 熵、交叉熵、KL 散度的关系
现在进入最关键部分。我们有三个概念:
① Entropy——世界本身的不确定性:
表示:如果你完全理解世界,最低需要多少信息。
② Cross Entropy——模型理解世界需要多少信息:
表示:如果模型使用自己的理解去描述真实数据,需要多少成本。
③ KL Divergence——模型理解错误造成的信息浪费:
三者关系:
8. 这个公式到底意味着什么?
展开理解:
也就是说,交叉熵包含两部分:
第一部分:——世界本身有多复杂,这是固定的,模型无法改变。
第二部分:——模型距离真实世界还有多远,这是模型可以优化的。
因此,训练模型最小化 ,实际上就是在最小化 ——也就是:
让模型的世界观越来越接近真实世界。
9. GPT 训练到底发生了什么?
训练前,模型输出 “Paris 0.2 / London 0.3 / Berlin 0.1 …”——它不了解世界,所以 很大。
经过大量训练,模型输出 “Paris 0.98”——预测分布接近真实语言分布,于是 。
所以:
GPT 训练的本质,不是记住更多句子,而是学习一个越来越接近真实世界的概率模型。
10. 为什么预测会产生智能?
因为预测需要理解规律。
看到“水加热到 100℃” → 预测“沸腾” → 掌握:温度 → 状态变化 → 物理规律
看到“医生使用” → 预测“听诊器” → 掌握:医生 → 医疗场景 → 工具关系
真正优秀的预测,背后一定包含世界结构。
11. 为什么大模型越大越强?
因为模型容量越大,能够表示更加复杂的概率分布:
小模型:学习 词 → 词
大模型:学习 词 → 概念 → 关系 → 因果 → 世界模型
它压缩的不只是文本,而是文本背后的规律。
12. Compression is Intelligence
把整个逻辑串起来:
世界 → 随机事件 → Entropy(衡量不确定性)
→ Compression(删除可预测部分)
→ Prediction(学习概率分布)
→ Cross Entropy(衡量预测成本)
→ KL Divergence(衡量模型距离真实世界的差距)
→ Deep Learning(不断减少 KL)
→ Intelligence
总结
如果用一句话理解:
Entropy 描述世界有多复杂,Cross Entropy 描述模型理解世界需要多少信息,而 KL Divergence 描述模型距离真实世界还有多少差距。
GPT 的训练目标 等价于 ,也就是说:
训练大模型,就是让一个神经网络不断压缩世界,并形成一个越来越准确的世界概率模型。
这也是为什么一个看似简单的任务——“预测下一个词”——最终能够产生语言理解、代码生成、推理能力、知识迁移。
因为预测的本质,不是猜答案,而是:学习世界运行的规律。
参考资料
-
视频推荐(交叉熵与信息论):