Elea Notes.

词条 · 理论 · 入门

信息量

一件事发生带来多少信息,等于它有多让你意外:概率越低,信息量越大。

也称:信息量、自信息、information content、self-information、surprisal、意外度

先看一个麻烦

两条消息,哪条”信息更多”?

  • A:明天太阳从东边升起。
  • B:明天本市下雪(七月)。

两句话字数差不多。但你会觉得 B 说了点什么,A 什么也没说。差别在哪?

朴素办法:数字数

按长度算信息量。A 十个字,B 九个字,所以 A 更多?

明显荒谬。长度衡量的是表达的开销,不是内容。一句”是”可能比一整页废话信息更多。

机制:信息量 = 意外度

香农的答案是:信息量取决于这件事有多不可能

一件概率为 p 的事发生,带来的信息量是

log2p比特-\log_2 p \quad \text{比特}

代进去看:

事件概率信息量
抛硬币正面1/21 比特
掷骰子得 61/6约 2.58 比特
太阳从东边升≈1≈0 比特
七月本市下雪1/1000约 10 比特

太阳照常升起的信息量是零,因为你早就知道了。概率越低的事,发生时告诉你的越多。

为什么用对数?因为要可加:两件独立的事一起发生,概率是相乘的,而我们希望信息量是相加的。对数正好把乘变成加。

回访:熵就是信息量的平均值

信息量说的是某一次具体结果有多意外。把所有可能结果的信息量按概率加权平均,就得到熵(见熵):

H=ipi(log2pi)H = \sum_i p_i \cdot (-\log_2 p_i)

所以两者关系很干净:信息量是单次的,熵是期望的。一个描述结果,一个描述信源。

这也解释了为什么”猜下一个字母”的游戏能测出英文的熵——每次猜中或猜错都在提供一次信息量的样本。

边界

信息量与”有用”无关。中奖号码和随机噪声可以有相同的信息量,但一个改变人生一个毫无价值。香农在论文开头就把这一层剥掉了:

These semantic aspects of communication are irrelevant to the engineering problem.

意义层面与工程问题无关。这不是疏忽,是有意的作用域切割——正因为不管意义,这套理论才对所有信源普适。

来源

  1. A Mathematical Theory of Communication