跳至内容
返回

交叉熵:为什么预测让 AI 变聪明?

发布于:

大语言模型的训练,本质上是在学习一个更接近真实世界的概率分布。

而交叉熵,就是衡量“模型理解世界还有多少差距”的工具。

现代人工智能,尤其是 GPT 类大语言模型,训练目标看起来非常简单:给定前面的文本,预测下一个 token

例如输入 “The capital of France is”,模型预测 “Paris”,然后计算预测是否正确。

很多人认为:GPT 不就是在做文本预测吗?

但真正的问题是:

为什么预测任务可以产生智能?为什么一个简单的预测目标能够让模型学会语言、知识甚至推理?

答案需要从信息论开始。


1. 信息到底是什么?

1948 年,Claude Shannon 提出了信息论。其中一个核心思想:

信息来自不确定性的减少。

假设有人告诉你“今天太阳升起”——你不会觉得有什么信息,因为这个事件太容易预测。但如果他说“明天太阳消失”,你会非常震惊,因为这个事件概率极低。

I(x)=logP(x)I(x)=-\log P(x)

表示一个事件包含的信息量。规律:

  • 越常见 → 信息越少
  • 越罕见 → 信息越多

2. 熵:世界本身有多少不确定性?

如果我们考虑一个随机系统,例如天气:晴天 50%、雨天 50%——我们无法提前知道结果,那么这个系统具有较高的不确定性。

Shannon 定义:

H(p)=p(x)logp(x)H(p)=-\sum p(x)\log p(x)

称为 Entropy(熵)。它表示:

如果完全知道这个世界的规律,描述它最少需要多少信息。

举两个极端:

情况 1:完全确定(太阳每天升起概率 = 100%)——没有未知:H=0H=0

情况 2:完全随机(正面 50%、反面 50%)——无法预测:熵最大。

所以:熵衡量的是世界本身的复杂程度。


3. 压缩为什么和预测有关?

假设我要保存一句话:

The cat is sitting on the mat

最简单的方法是保存每个字符:T h e c a t …

但是如果机器理解英语规律,看到 “The cat is sitting on the”,它知道 “mat” 的概率很高——那么 “mat” 就不需要完整保存。这就是压缩。

因此:

压缩不是删除信息,而是删除已经可以预测的信息。

一个更强的预测模型,意味着更短的信息表示。所以:预测能力↑ 意味着 压缩能力↑


4. GPT 为什么预测下一个 Token?

GPT 的训练过程:输入 “The cat sat on the”,输出概率:

mat   0.7
floor 0.2
chair 0.05
...

模型不是直接输出答案,而是产生一个概率分布——也就是模型认为“下一步可能是什么”。

训练的目标:让这个概率分布越来越接近真实语言规律。这就是 Cross Entropy(交叉熵)


5. 什么是交叉熵?

假设真实世界概率为 p(x)p(x),模型预测概率为 q(x)q(x)

例如真实分布:“Paris = 100%”。

模型 A:Paris 0.9 / London 0.1——模型还是比较理解。

模型 B:Paris 0.001 / London 0.999——虽然最后可能猜对一次,但它实际上“不相信正确答案”。

因此我们需要衡量:**如果模型使用自己的概率分布描述真实世界,需要多少信息?**这就是交叉熵:

H(p,q)=p(x)logq(x)H(p,q) = -\sum p(x)\log q(x)


6. 为什么交叉熵是训练 AI 的核心?

对于分类任务,真实标签是“猫”:

模型输出“猫 0.99 / 狗 0.01” → Loss =log(0.99)=-\log(0.99),很小。

模型输出“猫 0.01 / 狗 0.99” → Loss =log(0.01)=-\log(0.01),巨大。

所以:

交叉熵惩罚的不是“你有没有猜错”,而是“你对于正确答案到底有多不确定”。


7. 熵、交叉熵、KL 散度的关系

现在进入最关键部分。我们有三个概念:

① Entropy——世界本身的不确定性:

H(p)H(p)

表示:如果你完全理解世界,最低需要多少信息。

② Cross Entropy——模型理解世界需要多少信息:

H(p,q)H(p,q)

表示:如果模型使用自己的理解去描述真实数据,需要多少成本。

③ KL Divergence——模型理解错误造成的信息浪费:

DKL(pq)=p(x)logp(x)q(x)D_{KL}(p\parallel q) = \sum p(x)\log\frac{p(x)}{q(x)}

三者关系:

H(p,q)=H(p)+DKL(pq)\boxed{H(p,q)=H(p)+D_{KL}(p\parallel q)}


8. 这个公式到底意味着什么?

展开理解:

CrossEntropy=真实世界复杂度+模型误差CrossEntropy = 真实世界复杂度 + 模型误差

也就是说,交叉熵包含两部分:

第一部分:H(p)H(p)——世界本身有多复杂,这是固定的,模型无法改变。

第二部分:DKL(pq)D_{KL}(p\parallel q)——模型距离真实世界还有多远,这是模型可以优化的。

因此,训练模型最小化 H(p,q)H(p,q),实际上就是在最小化 DKL(pq)D_{KL}(p\parallel q)——也就是:

让模型的世界观越来越接近真实世界。


9. GPT 训练到底发生了什么?

训练前,模型输出 “Paris 0.2 / London 0.3 / Berlin 0.1 …”——它不了解世界,所以 DKLD_{KL} 很大。

经过大量训练,模型输出 “Paris 0.98”——预测分布接近真实语言分布,于是 DKL0D_{KL} \to 0

所以:

GPT 训练的本质,不是记住更多句子,而是学习一个越来越接近真实世界的概率模型。


10. 为什么预测会产生智能?

因为预测需要理解规律。

看到“水加热到 100℃” → 预测“沸腾” → 掌握:温度 → 状态变化 → 物理规律
看到“医生使用”     → 预测“听诊器” → 掌握:医生 → 医疗场景 → 工具关系

真正优秀的预测,背后一定包含世界结构。


11. 为什么大模型越大越强?

因为模型容量越大,能够表示更加复杂的概率分布:

小模型:学习 词 → 词
大模型:学习 词 → 概念 → 关系 → 因果 → 世界模型

它压缩的不只是文本,而是文本背后的规律


12. Compression is Intelligence

把整个逻辑串起来:

世界 → 随机事件 → Entropy(衡量不确定性)
  → Compression(删除可预测部分)
  → Prediction(学习概率分布)
  → Cross Entropy(衡量预测成本)
  → KL Divergence(衡量模型距离真实世界的差距)
  → Deep Learning(不断减少 KL)
  → Intelligence

总结

如果用一句话理解:

Entropy 描述世界有多复杂,Cross Entropy 描述模型理解世界需要多少信息,而 KL Divergence 描述模型距离真实世界还有多少差距。

GPT 的训练目标 minH(p,q)\min H(p,q) 等价于 minDKL(pq)\min D_{KL}(p\parallel q),也就是说:

训练大模型,就是让一个神经网络不断压缩世界,并形成一个越来越准确的世界概率模型。

这也是为什么一个看似简单的任务——“预测下一个词”——最终能够产生语言理解、代码生成、推理能力、知识迁移。

因为预测的本质,不是猜答案,而是:学习世界运行的规律。


参考资料


在以下平台分享此文章:

上一篇
论文阅读:SE-COT(CVPR 2025)——思维链引导的风格演化(Single-DGOD)
下一篇
从熵到大模型:为什么“预测”就是一种压缩?