词条 · 理论 · 入门
信息量
一件事发生带来多少信息,等于它有多让你意外:概率越低,信息量越大。
也称:信息量、自信息、information content、self-information、surprisal、意外度
先看一个麻烦
两条消息,哪条”信息更多”?
- A:明天太阳从东边升起。
- B:明天本市下雪(七月)。
两句话字数差不多。但你会觉得 B 说了点什么,A 什么也没说。差别在哪?
朴素办法:数字数
按长度算信息量。A 十个字,B 九个字,所以 A 更多?
明显荒谬。长度衡量的是表达的开销,不是内容。一句”是”可能比一整页废话信息更多。
机制:信息量 = 意外度
香农的答案是:信息量取决于这件事有多不可能。
一件概率为 p 的事发生,带来的信息量是
代进去看:
| 事件 | 概率 | 信息量 |
|---|---|---|
| 抛硬币正面 | 1/2 | 1 比特 |
| 掷骰子得 6 | 1/6 | 约 2.58 比特 |
| 太阳从东边升 | ≈1 | ≈0 比特 |
| 七月本市下雪 | 1/1000 | 约 10 比特 |
太阳照常升起的信息量是零,因为你早就知道了。概率越低的事,发生时告诉你的越多。
为什么用对数?因为要可加:两件独立的事一起发生,概率是相乘的,而我们希望信息量是相加的。对数正好把乘变成加。
回访:熵就是信息量的平均值
信息量说的是某一次具体结果有多意外。把所有可能结果的信息量按概率加权平均,就得到熵(见熵):
所以两者关系很干净:信息量是单次的,熵是期望的。一个描述结果,一个描述信源。
这也解释了为什么”猜下一个字母”的游戏能测出英文的熵——每次猜中或猜错都在提供一次信息量的样本。
边界
信息量与”有用”无关。中奖号码和随机噪声可以有相同的信息量,但一个改变人生一个毫无价值。香农在论文开头就把这一层剥掉了:
These semantic aspects of communication are irrelevant to the engineering problem.
意义层面与工程问题无关。这不是疏忽,是有意的作用域切割——正因为不管意义,这套理论才对所有信源普适。
来源
提到这个词条的文章
- 比特币白皮书逐节拆解经典拆解 2026-07-31
- 通信的数学理论逐节拆解经典拆解 2026-07-31
- OSWorld 90.19% 的成绩核验:框架、代码动作与步数上限 2026-07-30
- PeerDAS:以 1/16 的下载量换取全量数据可用性保证 2026-07-30