理解 ChatGPT 的第一步,也许不是 Transformer,而是信息论。
很多人第一次接触大语言模型(LLM)时,会产生一个疑问:
“它到底是真的理解语言,还是只是在预测下一个词?”
这个问题看似简单,但背后隐藏着一个非常深刻的思想:
预测,本质上就是压缩。
而压缩,是理解智能的一条重要路径。
3Blue1Brown 在视频《Reinventing Entropy | Compression & Intelligence Part 1》中,用非常直观的方式重新解释了 Shannon 熵,并提出一个非常有启发性的观点:
一个系统越能够准确预测未来,就越能够压缩信息。
这句话,连接了信息论、机器学习以及现代 AI。
1. 什么是信息?
首先,我们需要理解:信息到底是什么?
假设有人告诉你:
“太阳从东方升起。”
你可能觉得:“这有什么信息量?”因为它太常见了。
但如果有人告诉你:
“明天太阳不会升起。”
你的第一反应:“不可能!”
为什么第二句话的信息量更大?因为它更加意外。
信息论之父 Claude Shannon 提出了一个核心思想:
信息量 ≈ 不确定性的减少。
一个事件越难预测,它包含的信息越多。数学表达:
其中 是事件发生的概率——概率越低,信息量越高。
| 事件 | 概率 | 信息量 |
|---|---|---|
| 今天太阳升起 | 很高 | 低 |
| 明天地球爆炸 | 极低 | 极高 |
所以:信息,本质上来自不可预测性。
2. 熵:衡量一个系统有多不可预测
如果一个系统包含很多随机事件,我们需要一个整体指标——这就是 Shannon Entropy(香农熵):
它表示:一个系统平均包含多少不确定性。
举个简单例子,假设一个硬币:
情况 A:100% 正面
你提前知道结果:
正 正 正 正 正
没有惊喜。熵:——因为没有信息。
情况 B:50% 正面,50% 反面
结果完全随机:
正 反 正 正 反 ...
熵最高。
所以:熵越高,越难预测。
3. 压缩为什么和预测有关?
现在进入核心。假设你有一句话:
今天晚上我要去吃饭
如果每个字都独立存储,需要很多空间。但是,如果机器知道中文规律,看到“今天晚上我要去”,它可以预测“吃饭”——那么“吃饭”就不需要完整保存,只需要保存“这里大概率出现吃饭”即可。
压缩的本质:不是删除信息,而是删除已经可以预测的信息。
另一个例子:
The cat is sitting on the mat.
如果每个字符保存,需要存下每一个字母。但如果机器知道英语,看到 “The cat is sitting on the”,后面出现 “mat” 的概率非常高——因此可以用更短的编码表示。
所以:更好的预测 → 更好的压缩。
4. 为什么 GPT 训练目标是预测下一个 Token?
现在回到 ChatGPT。GPT 的训练目标:给定 “The capital of France is”,预测 “Paris”。数学上就是最大化:
也就是让模型越来越会预测。
很多人误解:GPT 只是背答案。实际上,它学习的是世界中的统计结构:
看到“医生拿着” → 模型知道可能“听诊器”
看到“量子力学中的” → 可能“波函数”
看到“机器学习模型训练需要” → 可能“数据”
它实际上学习了语言背后的规律。
5. 为什么预测能力会产生“智能”?
这里出现一个非常有趣的问题:为什么预测可以产生智能?
原因是:理解世界,需要建立一个可以预测世界的模型。
比如一个婴儿学习:看到“球从桌子掉下来”,下一秒球落地——婴儿的大脑形成了“物体 → 重力 → 运动”的预测模型。
科学也是如此:
- 牛顿力学:不是简单描述过去,而是预测“如果施加力 F,未来运动是什么?”
- 爱因斯坦相对论:也是预测“高速运动下时间如何变化?”
所以:科学 = 压缩世界规律。
6. 大模型为什么像“压缩器”?
训练 GPT:输入几十 TB 文本,输出一个模型参数。本质上,模型把大量文本中的规律压缩进去。
例如训练数据:
苹果是一种水果
香蕉是一种水果
橙子是一种水果
模型不会保存三条独立的映射,而是学习“水果分类规律”。这就是从记忆到规律。
优秀模型不是存储更多,而是找到更短的表示。
7. 为什么大模型规模越大,能力越强?
如果智能来自压缩,那么更大的模型意味着更强的表示能力:
小模型:只能学习简单规律(猫 → 动物)
大模型:可以学习复杂规律
猫 → 动物 → 生态系统 → 文化符号 → 文学隐喻
它压缩的不只是文字,而是人类知识结构。
8. 但是:压缩不等于真正理解?
这里存在一个重要问题:如果智能 = 压缩,那么 ZIP 文件是不是智能?当然不是。
为什么?因为 ZIP 只能保存精确规律,但 AI 需要处理:模糊性、推理、创造、泛化。
所以更准确地说:
智能是一种高级压缩能力,它不仅压缩数据,还压缩世界规律。
9. 对未来 AI 的启发
如果这个观点成立,那么未来 AI 的方向可能不是“让模型记更多知识”,而是“让模型找到更好的世界表示”。未来模型可能更加关注:
- 更好的压缩:找到更抽象的规律;
- 更好的预测:预测文字、视频、世界状态;
- 更好的表示:学习物理规律、社会规律、因果关系。
总结:一句话理解现代 AI
大语言模型不是简单地生成文字,而是在寻找一种能够最大程度压缩人类知识的方法;而预测,是压缩世界的最有效方式。
Shannon 熵告诉我们:信息来自不可预测。机器学习告诉我们:学习就是减少不可预测。而大模型告诉我们:智能,也许就是寻找世界最简洁表达的能力。
延伸阅读
- Shannon 信息论:Entropy 是如何定义信息量的
- Minimum Description Length(MDL):模型选择与压缩理论
- Kolmogorov Complexity:用最短描述定义复杂性
- Predictive Coding:大脑如何通过预测学习世界
- GPT 与 Scaling Law:为什么更大模型会涌现能力
这也是为什么现在很多研究者开始重新审视一个问题:
“智能是否本质上是一种压缩?”
这个问题,可能比“Transformer 为什么有效”更加接近 AI 的本质。
参考资料
-
视频推荐(3Blue1Brown《Reinventing Entropy | Compression & Intelligence Part 1》):
-
相关讨论: