跳转至

数据科学

信息熵是怎么来的?——从“问问题”到香农公式的直觉推导

为什么需要一把“信息尺子”

我们每天都说“这条消息信息量很大”“那句话啥也没说”,但“信息”到底有多少?能不能像称体重、量身高那样,给信息一个确切的数字?

1948年,克劳德·香农给出了答案——信息熵。但这不是拍脑袋想出来的公式,而是从几个几乎“废话”般的直觉出发,一步步推导出来的。这篇文章就带你走一遍这条推导之路,让你不仅知道公式长什么样,更知道它为什么长这样。

第1步:从“猜卡片”获得原始直觉

想象你有一堆编号卡片(1~8),要找出某一张,每次只能问“是/否”问题。怎样问最快?

答案很朴素:每次把剩余可能性对半分。8张卡,问3次;16张卡,问4次。每问一次,不确定性减半,你就获得了1个单位的“信息”。

这个例子告诉我们:

信息的价值 = 它消除了多少不确定性。

但“不确定性”怎么量化?总不能说“这条消息有5斤信息”吧。我们需要一个数学公式。

数学符号参考手册 —— 线性代数、微积分、集合、函数、概率统计速查

无论是阅读深度学习论文、复现经典算法,还是推导新的模型,数学符号都是绕不开的“第一道门槛”。然而,不同教材、不同论文的符号习惯往往各不相同,常常让人在 \mathbf{x}\boldsymbol{x}E[X]\mathbb{E}[X] 之间晕头转向。

本文整理了一份面向机器学习与深度学习的数学符号速查参考,涵盖集合、函数、线性代数、微积分、概率统计等常用领域。所有符号均采用 Obsidian 兼容的 MathJax 格式(毕竟Obsidian是我最喜欢的一款笔记软件),你可以直接复制到笔记中使用,无需额外配置。无论你是初学者还是需要快速查阅的老手,希望这份手册能成为你案头常备的“符号字典”。