跳至内容
返回

从熵到大模型:为什么“预测”就是一种压缩?

发布于:

理解 ChatGPT 的第一步,也许不是 Transformer,而是信息论。

很多人第一次接触大语言模型(LLM)时,会产生一个疑问:

“它到底是真的理解语言,还是只是在预测下一个词?”

这个问题看似简单,但背后隐藏着一个非常深刻的思想:

预测,本质上就是压缩。

而压缩,是理解智能的一条重要路径。

3Blue1Brown 在视频《Reinventing Entropy | Compression & Intelligence Part 1》中,用非常直观的方式重新解释了 Shannon 熵,并提出一个非常有启发性的观点:

一个系统越能够准确预测未来,就越能够压缩信息。

这句话,连接了信息论、机器学习以及现代 AI。


1. 什么是信息?

首先,我们需要理解:信息到底是什么?

假设有人告诉你:

“太阳从东方升起。”

你可能觉得:“这有什么信息量?”因为它太常见了。

但如果有人告诉你:

“明天太阳不会升起。”

你的第一反应:“不可能!”

为什么第二句话的信息量更大?因为它更加意外

信息论之父 Claude Shannon 提出了一个核心思想:

信息量 ≈ 不确定性的减少。

一个事件越难预测,它包含的信息越多。数学表达:

I(x)=logP(x)I(x)=-\log P(x)

其中 P(x)P(x) 是事件发生的概率——概率越低,信息量越高

事件概率信息量
今天太阳升起很高
明天地球爆炸极低极高

所以:信息,本质上来自不可预测性。


2. 熵:衡量一个系统有多不可预测

如果一个系统包含很多随机事件,我们需要一个整体指标——这就是 Shannon Entropy(香农熵)

H(X)=p(x)logp(x)H(X)= -\sum p(x)\log p(x)

它表示:一个系统平均包含多少不确定性。

举个简单例子,假设一个硬币:

情况 A:100% 正面

你提前知道结果:

正 正 正 正 正

没有惊喜。熵:H=0H=0——因为没有信息。

情况 B:50% 正面,50% 反面

结果完全随机:

正 反 正 正 反 ...

熵最高。

所以:熵越高,越难预测。


3. 压缩为什么和预测有关?

现在进入核心。假设你有一句话:

今天晚上我要去吃饭

如果每个字都独立存储,需要很多空间。但是,如果机器知道中文规律,看到“今天晚上我要去”,它可以预测“吃饭”——那么“吃饭”就不需要完整保存,只需要保存“这里大概率出现吃饭”即可。

压缩的本质:不是删除信息,而是删除已经可以预测的信息

另一个例子:

The cat is sitting on the mat.

如果每个字符保存,需要存下每一个字母。但如果机器知道英语,看到 “The cat is sitting on the”,后面出现 “mat” 的概率非常高——因此可以用更短的编码表示。

所以:更好的预测 → 更好的压缩


4. 为什么 GPT 训练目标是预测下一个 Token?

现在回到 ChatGPT。GPT 的训练目标:给定 “The capital of France is”,预测 “Paris”。数学上就是最大化:

P(next tokencontext)P(next\ token \mid context)

也就是让模型越来越会预测。

很多人误解:GPT 只是背答案。实际上,它学习的是世界中的统计结构

看到“医生拿着”     → 模型知道可能“听诊器”
看到“量子力学中的” → 可能“波函数”
看到“机器学习模型训练需要” → 可能“数据”

它实际上学习了语言背后的规律。


5. 为什么预测能力会产生“智能”?

这里出现一个非常有趣的问题:为什么预测可以产生智能?

原因是:理解世界,需要建立一个可以预测世界的模型。

比如一个婴儿学习:看到“球从桌子掉下来”,下一秒球落地——婴儿的大脑形成了“物体 → 重力 → 运动”的预测模型。

科学也是如此:

  • 牛顿力学:不是简单描述过去,而是预测“如果施加力 F,未来运动是什么?”
  • 爱因斯坦相对论:也是预测“高速运动下时间如何变化?”

所以:科学 = 压缩世界规律。


6. 大模型为什么像“压缩器”?

训练 GPT:输入几十 TB 文本,输出一个模型参数。本质上,模型把大量文本中的规律压缩进去。

例如训练数据:

苹果是一种水果
香蕉是一种水果
橙子是一种水果

模型不会保存三条独立的映射,而是学习“水果分类规律”。这就是从记忆到规律

优秀模型不是存储更多,而是找到更短的表示。


7. 为什么大模型规模越大,能力越强?

如果智能来自压缩,那么更大的模型意味着更强的表示能力:

小模型:只能学习简单规律(猫 → 动物)
大模型:可以学习复杂规律
  猫 → 动物 → 生态系统 → 文化符号 → 文学隐喻

它压缩的不只是文字,而是人类知识结构


8. 但是:压缩不等于真正理解?

这里存在一个重要问题:如果智能 = 压缩,那么 ZIP 文件是不是智能?当然不是。

为什么?因为 ZIP 只能保存精确规律,但 AI 需要处理:模糊性、推理、创造、泛化。

所以更准确地说:

智能是一种高级压缩能力,它不仅压缩数据,还压缩世界规律。


9. 对未来 AI 的启发

如果这个观点成立,那么未来 AI 的方向可能不是“让模型记更多知识”,而是“让模型找到更好的世界表示”。未来模型可能更加关注:

  1. 更好的压缩:找到更抽象的规律;
  2. 更好的预测:预测文字、视频、世界状态;
  3. 更好的表示:学习物理规律、社会规律、因果关系。

总结:一句话理解现代 AI

大语言模型不是简单地生成文字,而是在寻找一种能够最大程度压缩人类知识的方法;而预测,是压缩世界的最有效方式。

Shannon 熵告诉我们:信息来自不可预测。机器学习告诉我们:学习就是减少不可预测。而大模型告诉我们:智能,也许就是寻找世界最简洁表达的能力。


延伸阅读

  • Shannon 信息论:Entropy 是如何定义信息量的
  • Minimum Description Length(MDL):模型选择与压缩理论
  • Kolmogorov Complexity:用最短描述定义复杂性
  • Predictive Coding:大脑如何通过预测学习世界
  • GPT 与 Scaling Law:为什么更大模型会涌现能力

这也是为什么现在很多研究者开始重新审视一个问题:

“智能是否本质上是一种压缩?”

这个问题,可能比“Transformer 为什么有效”更加接近 AI 的本质。


参考资料


在以下平台分享此文章:

上一篇
交叉熵:为什么预测让 AI 变聪明?
下一篇
对比学习:从“拉近正样本,推远负样本”到 CLIP 的多模态世界