1. 信息论的起点:我们每天都在做信息处理,却很少想它是怎么被度量的
你有没有想过一个问题:你说了一句话,对方到底"收到"了多少信息?微信发一张照片,压缩之后体积变小了,画质好像也没差多少,这个"压缩"到底压掉了什么?U盘拷文件,中途提示"数据损坏",又是靠什么把坏掉的数据找回来的?
这些看起来八竿子打不着的问题,其实都被同一门学科管着——信息论。
我最早接触信息论的时候,以为它就是一套数学公式,算算熵、算算信道容量就完事了。后来自己动手做数据传输相关的项目,踩了压缩、纠错、协议设计的坑,回头再看才发现:信息论真正厉害的地方,不是那一堆公式本身,而是它提供了一个非常统一、非常底层的框架,告诉你"信息"这个东西到底是怎么产生、怎么度量、怎么传输、怎么保真的。这也就是标题里说的——信息论的对象与方法。
这篇文章我想从一个从业者的视角,把这个框架给你拆开来讲。不是给你背定义,而是带你过一遍信息论在研究什么、它怎么思考问题、以及这些思考和"编码"是怎么挂上钩的。不管你是在做通信、写代码、搞数据压缩,还是纯粹想搞明白"信息"的本质,这篇文章都值得你看完。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 信息论在解决什么问题:从一次普通的对话说起
2.1 一段对话里藏着的三个问题
设想一个特别普通的场景:你在嘈杂的地铁里给朋友打电话,说"晚上七点老地方见"。结果对方手机信号不好,听成了"晚上吃面老地方见"。虽然"七点"和"吃面"听起来差了十万八千里,但你在说这句话之前和之后,信息的变化是实打实的——你说出去的是一段话,对方收到的是另一段话,中间隔着噪声和失真。
把场景再扩大一点:你往朋友圈上传一张照片,服务器把照片压缩存储,别人下载时再解码还原。照片从拍摄到展示,经历了"编码—存储/传输—解码"的全过程。压缩率太高,图片糊了;压缩率太低,流量扛不住。这里面的度在哪里?视频网站让你选择"流畅""高清""超清",背后其实是同一部电影在不同码率下的编码方案,而不同码率对应着不同大小的信息量。
这些看起来完全不同的场景,抽象到最底层,其实都在问同样三个问题:
- 信息能不能被量化?一段话、一张图、一个视频,到底携带"多少"信息?
- 信息能不能被压缩到极致?压缩到什么程度会丢信息,什么程度不丢?
- 在有干扰的信道里,信息能不能可靠传输?要多花多少代价才能换回来可靠性?
这三个问题,就是信息论研究的对象。
2.2 香农模型:信息论的"解剖图"
1948年,香农发表了一篇划时代的论文,《通信的数学理论》。他做了一件特别绝的事情:把一切通信系统抽象成一个通用的模型。
这个模型特别简单,就五个环节:
- 信源:产生信息的地方,比如说话的人、摄像头、传感器
- 编码器:把信源的信息转成适合传输的形式,比如把语音变成比特流
- 信道:承载信号的媒介,比如空气、网线、无线电波
- 译码器:把收到的信号还原成信息
- 信宿:最终接收信息的一方
你手机里的所有通信行为,从打电话到刷网页,没有一样逃得出这个框架。语音进麦克风是信源,语音编码器把声音变成比特流,比特流经过调制后在无线信道里飞,接收端解调、译码,最后扬声器把声音放出来。
这个模型最厉害的地方在于:它把所有通信问题的共性抽离出来,让"信息"第一次可以被独立研究。在此之前,通信工程师研究的是怎么把电信号做漂亮,怎么把天线设计好,而香农告诉大家:这些都可以先放一边,我们先把"信息本身"的规则搞清楚。
2.3 通信不只是"把信号传出去"
很多非通信专业的人第一次听说信息论,会以为它研究的只是"怎么把数据从A传到B",觉得这事早就被TCP/IP协议解决了。这其实是个很大的误解。
信息论关心的问题要比"传输"大得多。它关心的是在给定信道的条件下,信息传输的理论极限在哪里;在给定信源统计特性的条件下,压缩的理论下限在哪里;在给定噪声水平的条件下,能不能找到一种编码方式,让错误率无限趋近于零。
这些问题的答案,不是某个协议或者某套代码能给出的,而是数学上先证明"能"或者"不能",然后再由工程师去设计具体的方案逼近这个极限。
理解了这一点,你就能理解为什么信息论的数学味道那么浓。因为它本质上是一门先回答"能不能"和"最多能到多少"的学科,而不是一门直接告诉你"怎么实现"的工程学科。但它给出的那些"极限",恰恰是所有通信系统和存储系统的设计基准。
3. 信息的度量:熵,以及它背后的直觉
3.1 信息量和"意外程度"有关
现在要面对一个核心问题:信息怎么度量?
先来做一个思维实验。假设我给你发了条消息,内容是"明天的太阳会从东边升起"。这条消息对你来说信息量大吗?大概率不大,因为这是你早就知道的、确定性百分百的事情。再假设我发的是"明天的太阳会从西边升起",那这条消息的信息量就大了,因为它完全出乎你的意料。
这个思维实验揭示了一个关键直觉:一条消息携带的信息量,和它出现的"概率"成反比。出现概率越高,信息量越低;出现概率越低,信息量越高。确定会发生的事情,信息量为零——因为它没有消除任何不确定性。
这就是信息度量的第一块基石。如果某个事件发生的概率是 p,那它携带的信息量就是:
$$I(x) = -\log_2 p(x)$$
负号保证了信息量为正,取以2为底的对数,单位是比特(bit)。为什么用2?因为信息论里最基本的选择就是二选一,比特就是"不确定性的个数"的单位。
3.2 熵:把不确定性"平均"一下
单个事件的信息量好算,但一个信源通常包含很多种可能的结果。比如掷骰子,可能出现1到6,每个概率都是1/6。那整个"掷骰子"这个信源平均带来多少信息量?这就需要一个加权平均,把每个可能结果的信息量按概率加权求和。这就是信息熵:
$$H(X) = -\sum_{i} p(x_i) \log_2 p(x_i)$$
拿掷骰子来算一下:六个结果每个概率都是1/6,每个结果的 $-\log_2(1/6) \approx 2.585$ 比特,六个加起来再求平均,算出来约等于2.585比特。它的含义是:每次掷骰子的结果平均需要大约2.585个比特才能表示。
但如果是一枚公平的硬币呢?正面反面概率各1/2,H(X) = -1/2 × (-1) + (-1/2) × (-1) = 1比特。非常直观:一个二进制结果,平均需要1个比特来编码。
现在这里有一个非常反直觉的结论:如果这枚硬币被做了手脚,正面概率是0.9,反面是0.1,算出来的熵会是多少?大概只有0.469比特。硬币的不确定性降低了,熵就变小了。换句话说,平均需要不到半个比特就能编码一次抛硬币的结果。这听起来很荒谬——抛硬币要么正要么反,怎么着也得用一个比特吧?
这正是信息论和直觉冲突最剧烈的地方。信息论的答案是:如果反面真的只出现10%,那你可以设计一种编码,用短码字表示高概率的正面,用长码字表示低概率的反面,平均下来每次抛硬币确实用不到1个比特。这个直觉,就是后面所有信源压缩编码的理论依据。
3.3 从熵到互信息:信息传递的"净收益"
单看熵还不够。信息论真正关心的是:经过一条信道传输之后,接收端到底获得了多少关于发送端的信息。这就引出了两个非常重要的概念:条件熵和互信息。
条件熵 $H(X|Y)$ 表示:在已知接收端收到Y的条件下,关于发送端X还剩下多少不确定性。如果信道完全没有噪声,收到Y就把X完全确定了,条件熵就是0。如果信道噪声特别大,收到Y对猜测X一点帮助都没有,条件熵就约等于无条件熵 $H(X)$。
互信息 $I(X;Y)$ 定义成 $H(X) - H(X|Y)$,它的含义是:接收信号Y给发送端X带来了多少信息量。这个量才是通信中真正有意义的东西——它衡量的是"信息传递的净收益"。
为什么在通信系统里大家天天聊"带宽""信噪比""误码率",但很少有人直接聊互信息?因为工程上这些指标更容易测量。但从香农的视角看,这些指标最终都汇聚到互信息这一个核心量上。信道容量能被计算出来,本质就是找到互信息的最大值。
3.4 熵不是信息,熵是不确定性
说到这我要专门提一个很多人初学时会踩的坑:熵本身不是信息的量,而是不确定性(平均信息量潜力)的度量。只有当你观测到某个事件发生后,"这次观测"带来的信息量才是 $-\log_2 p(x)$,而熵是这个过程在概率意义上的期望。
这就好比你买了一张彩票,在开奖之前,"这张彩票的信息熵"描述的是所有可能结果的不确定性。开奖之后,实际结果确定下来了,你收到的"这次开奖信息"就只是具体结果对应的事件信息量。这两个概念在一个语境里经常被混用,但要想真正理解信息论,得从一开始就分清:熵是面向信源性质的度量,信息量是面向单次事件的度量。
4. 从度量到方法:编码,信息论的实践起点
4.1 编码的本质:重新表达信息
信息论提出了一套度量方法,但它不是为了度量而度量。度量之所以重要,是因为有了度量,我们才知道"什么做得好""什么做得差",然后才有优化空间。
优化的工具是什么?是编码。
所谓编码,本质上是"对信息进行重新表达"。同一份信息,可以用不同的方式表达,表达方式的优劣会直接影响传输和存储的效率、可靠性。信息论给编码提供了两个方向的指导:
- 信源编码:尽量去掉冗余,用最少的比特表达信源信息。典型代表就是ZIP压缩、JPEG图片、H.264/H.265视频编码。它的目标是逼近信源的熵——即压缩率不能低于理论极限。
- 信道编码:在信息中主动引入受控的冗余,让接收端能够发现甚至纠正传输过程中的错误。典型代表是硬盘上的RS(Reed-Solomon)纠错码、WiFi和5G里的LDPC码、手机存储里的Turbo码。它的目标是逼近信道容量——即拿最小的冗余代价换最大的纠错能力。
有没有发现,这两个方向正好是相反的。信源编码想尽办法扔掉冗余,信道编码想尽办法加上冗余。一个通信系统里两个方向的编码是先后串联的:先信源编码把信息压缩到极致,再信道编码加入可控冗余来应对信道噪声。
4.2 一个简单的例子:抛硬币的Huffman编码实践
回到刚才那个不公平硬币的例子。正面概率0.9,反面概率0.1,熵大约0.469比特。我们怎么设计一种编码,用少于1个比特的平均长度来表示一次抛硬币的结果?
哈夫曼编码(Huffman Coding) 就是最经典的答案。它的构造规则特别简单:每次从待编码的符号集合里挑出概率最小的两个符号,把它俩合并成一个新符号,概率相加,记下合并路径,重复直到只剩一个符号。然后沿着合并树从根到叶子分别标0和1,每个叶子对应的0/1序列就是它的编码。
在这个例子里,只有两个符号,正面概率0.9,反面概率0.1,直接把这两个符号合并成一个根节点,正面标0,反面标1。这个编码表就是:正面→0(1个比特),反面→1(1个比特)。平均码长1比特,并没有比直接编码好到哪里去。
注意,哈夫曼编码对两个符号的场景无能为力——因为每个符号必须配一个码字,最省也只能做到每个码字1个比特。这就是信息论里一个非常重要的区分:单符号的熵(0.469比特)是"平均信息量",而可实现的编码平均码长还受码字长度整数化的约束。要真正逼近0.469比特,需要对多个抛硬币结果做分组编码。比如一次编码10次抛硬币的结果,高频结果(10次全是正面)给极短的码字,低频结果(有概率低的组合)给长码字,这样平均下来就能明显低于1比特。
这个例子非常典型,因为它揭露了信源编码的第一个核心技巧:别一次编一个符号,把符号序列分组来编码,才能逼近熵极限。后面发展出来的算术编码、LZW等算法,本质上都是沿着这个思路在往前走。
4.3 信源编码与信道编码的分工
有些初学者会问:为什么非要分信源编码和信道编码?不能找到一个编码同时兼顾压缩和纠错吗?
答案是:理论上可以,工程上不建议,也不必要。这就是分离定理(信源信道分离定理)告诉我们的:在单用户点对点通信场景下,先最优压缩再最优信道编码,可以达到与联合编码相同的理论极限。也就是说,分成两个步骤来做,不会损失任何性能。
这个结论意义太大了。它让整个通信系统的设计可以分层,各层干各层的事。你要压缩一个视频,不需要关心物理信道的噪声特性;你要给数据加纠错码,不需要关心视频内容是什么。这也是今天整个互联网协议栈能工作的重要理论基石。
5. 信息论对"编码"的多种延伸:从经典编码到现代技术
5.1 从哈夫曼到LZ、LZW:走向通用的压缩方法
哈夫曼编码是信源编码的经典代表,但它有个硬伤:它需要预先知道每个符号的出现概率,而且它对符号之间相关性强的数据(比如自然语言、图像)压缩能力有限。因为自然语言里字母和字母之间是有强关联的,"th"出现频繁极高,而"tx"几乎不出现,这种模式哈夫曼编码是捕捉不到的。
这就推动了另一类信源编码的出现:基于字典的编码方法,典型代表是LZ77/LZ78,以及它的变体LZW。这类编码的思路是:在编码过程中动态维护一个字典,遇到重复的字符串就用一个短的索引替代。GIF图像格式用的就是LZW,ZIP格式用的也是LZ77的变体(Deflate)。
LZW编码的巧妙之处在于它不需要预知概率分布,也不需要把字典事先传给接收端,接收端可以在解码过程中同步重建字典。我记得第一次亲手实现LZW的时候,最惊讶的地方就是解码器居然能在没有字典的情况下,一边解码一边把字典"重新长出来",这种自举式的设计非常精彩。
你在网络上搜"信息论与编码实验python",除了哈夫曼编码,最常出现的实验就是LZW,就是因为它的原理直观、实现简单,而且能看到压缩率随着输入数据重复度的变化而剧烈变化——这就是"去冗余"这个概念的活教材。
5.2 从信源编码看AV1、HEVC:现代视频编码的底层逻辑
刚才聊的哈夫曼、LZW都是无损编码,解压后和原文一模一样。但视频、音频、图片这些数据,人眼和人耳根本不关心每个像素的精确值,只要观感上差不多就行。这就催生了有损压缩的广阔空间。
现代视频编码标准,从H.264到H.265/HEVC再到AV1,它们的整体框架惊人地相似:先把画面分成小块,做帧内预测和帧间预测,把"预测残差"变换到频域(DCT),量化掉高频细节,最后用熵编码(哈夫曼或算术编码)压缩量化后的系数。
你会发现,这套流程里处处都是信息论的影子。预测是为了消除空间和时间上的相关性——相关性就是冗余,冗余越低,熵越低。量化是在引入受控失真,换取码率的下降。熵编码是最后一步逼近熵极限的动作。整个视频编码器,本质上就是一个极其精密的"熵减少"机器。
你在热搜词里看到的"40系显卡支持AV1硬件编码吗",背后就是这个逻辑:AV1能比H.264省30%到50%的码率,但计算复杂度也高得多,所以需要专门的硬件编码器来实时搞定。显卡厂商把AV1硬件编码作为卖点,本质上是把"更接近信息论极限的压缩算法"搬进了芯片。
5.3 从信道编码看LDPC、RS码与二维码
聊完信源编码,再看信道编码。信道编码研究的是怎么在数据里加冗余来抗干扰。如果你想给朋友传一句话,但中间要经过一段特别能"篡改"内容的通道,最笨的办法是把同样的话重复说三遍,三局两胜。但这样效率太低了。信道编码要解决的就是:用最少的冗余获得最强的纠错能力。
LDPC码(低密度奇偶校验码) 是当下5G、WiFi、光纤通信里的宠儿。它的校验矩阵非常稀疏——矩阵里大部分元素是0,只有少数是1。这种稀疏性让它的译码可以用一种迭代算法完成,复杂度随码长增长得很慢,性能又能逼近香农极限。
说来有点意思,LDPC码是1962年就提出的方案,但因为当时计算能力太弱,根本译不出来,被埋没了三十多年。直到90年代末Turbo码出现,大家重新燃起了对逼近香农极限的编码方案的兴趣,才把LDPC从故纸堆里翻出来,发现它性能极好、非常适合硬件并行实现。这是信息论历史上非常经典的"理论超前于工程"的案例。
另一个日常能见到的例子是QR码(二维码)。二维码为什么在部分被遮挡、残缺的情况下还能扫出来?因为它用了RS纠错码。RS码把信息分割成块,对每一块生成冗余符号,只要损伤没超过设计阈值,接收端就能根据冗余符号把原始信息完整恢复出来。这跟你用U盘拷贝数据时底层ECC校验是同一个数学工具。
5.4 注意区分:字符编码和信息论"编码"
在热搜词里你会看到很多关于字符编码的内容,比如UTF-8和GBK的转换、Python里的编码处理、PEP8编码规范、编译器编码报错等等。这里必须做一个区分:程序开发领域说的"编码",大部分时候指的是"字符编码",它和信息论里说的"编码"是两码事。
字符编码解决的是"用什么数字代表哪个字符"的问题,它是人到计算机的一种约定。UTF-8、GBK、ASCII,这些是字符编码的方案。它的核心工作是建立字符集和字节序列之间的映射关系,属于计算机科学里偏工程、偏标准的范畴。
而信息论里的编码,如信源编码和信道编码,解决的是"如何用最少的比特表达信息""如何加冗余抗噪"的问题。二者虽然都用"编码"这个词,但关心的对象和评价标准完全不同。
一个有意思的交汇点:"Win11下把系统编码从GBK改成UTF-8"这类操作,本质上是改变了文件字节流和字符之间的映射规则。而"以GBK方式读取UTF-8编码的中文后又用UTF-8再次读取"会出现乱码,这也是因为映射搞乱了,跟信息论里的编码定理没有任何关系。这两个领域经常被混为一谈,但看问题的时候一定要分清你在讨论的是哪一层。
5.5 网络编码:让中间节点从"转发"变成"计算"
传统的路由转发只是把数据包原样从中间节点传下去,中间节点不做任何处理。网络编码提出了一种截然相反的思想:允许中间节点把收到的多个数据包做线性组合(比如异或、加权求和)再转发出去,接收端通过接收足够多的组合结果,反解出原始数据。
为什么要这么做?在网络丢包或者用广播信道传输时,如果只是转发,某些接收端会因为缺少某个包而无法恢复全部数据。但通过编码组合,每个接收端只要收到足够数量的编码包(不管具体是哪些),就能解出全部原始信息。这一下就把"对具体哪个包缺失"的敏感性降低了很多。这类思想已经应用在无线mesh网络、P2P内容分发和一些分布式存储系统中。
从信息论的角度看,网络编码最深刻的贡献是:它把"中继转发"这个原本被认为不可能带来信息增益的操作,变成了可以主动参与信息处理的过程,打破了传统点对点信息流模型的一些局限。当然,实际的工程应用还面临计算开销和延迟等权衡,但它是非常值得关注的一个方向。
6. 从热搜词看信息论的活学活用:常见疑问与动手建议
6.1 为什么网络/系统里到处都是"编码"类的问题
在最新的网络热词里,你会看到各种编码相关的话题满天飞:Java里文件读写乱码了、Ajax请求返回中文乱码了、Shell脚本是UTF-8还是GBK了、Python解析JSON中文变编码了、Python按照PEP8规范写代码、AI编码助手怎么用、MISRA C编码规范等等。
这些热词里有一大半是"字符编码+工程规范"的问题,还有一部分是"利用信息论思想做数据压缩/通信优化"的问题,还有一部分是"编码工具"的话题。很多初学者在看到"编码"两个字的时候容易一头雾水,觉得是不是都要懂信息论才能搞定。
我的建议是:先分清场景。如果是程序里字符显示乱码、格式不对,那是字符编码和字符集的问题,查UTF-8、GBK、Unicode的转换规则就能解决,跟信息论的理论没什么关系。如果你在折腾数据压缩、图片视频编码参数、通信协议纠错、或者研究二维码和硬盘的纠错原理,那信息论的相关内容才能真正帮上忙,像熵、互信息、香农极限这些概念就特别有价值。
6.2 想动手验证信息论概念,可以先从Python做起
在热搜词里有"信息论与编码python""信息论与编码实验python"这种词组,说明越来越多的人想动手实验。我非常推荐这个方向,因为信息论的很多概念光看公式很抽象,但你亲手写一遍代码,算一遍熵,编一次哈夫曼码,压缩一个文件看看压缩率,立刻就明白了。
动手时我会按照下面的顺序来做:
- 写一个函数,输入一个概率分布,输出它的熵。然后分别算公平硬币、不公平硬币、六面骰子、真实英文文本字母分布的熵。这个练习能帮你建立起"熵跟概率分布形状有关"的直觉——分布越不均匀,熵越小。
- 实现一个哈夫曼编码器,对一个文本文件做编码和解码,观察平均码长和理论熵的差距。再实现一个LZW编码器,压缩一个重复度高的文件和一个重复度低的文件,对比压缩率差异。
- 如果还有精力,可以实现一个最简单的信道编码仿真:随机生成比特流,加噪声,分别用无纠错和用最简单的重复码传输,对比误码率。你会发现加了冗余之后误码率显著下降,但代价是传输效率下降,这就是通信系统里"可靠性-效率"权衡的最直观演示。
6.3 信息论的方法论对其他领域有什么启发
最后想聊聊信息论的方法论意义。你学完信息论之后最强烈的感受,可能是它可以作为一个"分析问题的通用视角"。
比如你做一个推荐系统,可以把用户行为序列看成一个信源,"不确定性"用熵来衡量,用户的点击行为越不可预测,信息量越大;你的推荐算法越精准,行为序列的熵就越小。比如你做日志压缩,可以把日志看成一个信源,看它的熵有多少,来判断压缩算法的提升空间还有多大。比如你在设计数据同步协议,可以用互信息的思路判断不同同步策略的"有效信息传输量"。
信息论给所有人的最核心启发,其实就两个词:定量和极限。先把问题量化,再找到理论极限,然后去找逼近极限的方案。这种思维方式一旦养成,你会发现很多模糊的工程讨论都可以转化为精确的数学问题。
我个人在实际做项目里,最常用的信息论经验就是:在看到任何一份数据之前先想"它的熵大概是多少",在看到任何一次网络传输的成功率之前先想"信道的容量上限在哪里"。这种"先找边界,再谈优化"的思维方式,能够帮你避免很多拍脑袋式的工程决策。
7. 收尾:信息论的价值在于眼光,而不只是公式
聊到这里,信息论的研究对象(信息的度量极限)和研究方法(从熵到互信息再到编码构造)已经基本铺开了。你会发现信息论这门学科特别有意思的地方在于:它自己并不发明具体的压缩算法或者纠错方案,但它给所有发明这类方案的人提供了一副"知道最优在哪"的眼镜。
我刚接触信息论那会儿,其实是被一堆公式劝退过一轮的。后来是在做真实的存储系统时才重新捡起来,因为遇到问题必须问"这个存储格式还有多少压缩空间",这时候才意识到熵、互信息这些概念不是学术玩具,而是能直接用在工程决策上的工具。
所以如果你正准备学或者正在学信息论,我的建议是:不用一上来就死磕数学证明,先把"信息可以被度量""压缩有下限""传输有上限"这些思想装进脑子里,再带着问题去补数学细节。等你亲手把一个文件的压缩率逼近熵附近的时候,那种"我站在香农肩膀上"的感觉会特别强烈。
如果这篇文章能让你在之后遇到"编码"相关话题时,脑中多出"这属于信源编码还是信道编码?理论极限在哪里?"这两个问题,它就达到目的了。
