---
title: 信息论：从概率分布到编码的学习路线
url: https://doc.liz6.com/theory/01-information-theory/00-learning-path
locale: zh
area: theory
tags:
- 基础理论
- 信息论
date: 2026-09-12
modified: 2026-09-12
description: 用同一个离散分布解释熵、编码长度和预测损失，辨认真实分布、假设分布与观测样本之间的区别。
---

# 信息论：从概率分布到编码的学习路线

适合知道概率、平均值和对数基本运算的读者。每次先写样本空间与概率，再计算信息量；不要求先学神经网络。前四篇建立主线，后面按压缩、学习或通信问题选择。

## 学完要能做什么

用同一个离散分布解释熵、编码长度和预测损失，辨认真实分布、假设分布与观测样本之间的区别。

## 必读顺序与阶段自检

1. [熵与信息度量](01-entropy-and-information-measures.md)。

   从两种二元分布开始：概率各半，以及 0.9/0.1。自检：用 base-2 对数计算熵，说明平均不确定性为什么不同；一个罕见事件的信息量不等于分布的熵。

2. [KL 散度与交叉熵](02-kl-divergence-and-cross-entropy.md) → [源编码与压缩](03-source-coding-and-compression.md)。

   固定真实分布，换一种预测或编码分布。自检：区分交叉熵与 KL，核对平均码长与熵的关系，指出码表的前缀条件和编码块长。

3. [信道容量与编码](04-channel-capacity-and-coding.md)。

   把编码放进有噪声的信道。自检：说明信道输入分布、噪声模型和速率各是什么；容量结论不等于任意短码都能零错误传输。

## 选读与前置边界

[率失真与信息瓶颈](05-rate-distortion-and-information-bottleneck.md)适合有损表示问题；[LLM 中的信息论](06-information-theory-in-llms.md)在熵、交叉熵与概率模型之后读；[条件信息与数据处理](07-conditional-information-and-data-processing.md)补充多变量关系。它们不应替代前四篇的具体概率计算。

## 完成主线的交付物

交付一份小分布的熵、两种预测分布的交叉熵与 KL、一个可解码码表和平均码长。改变真实分布后重新检查结论。网络吞吐与等待请分别接[网络路线](../../networking/00-learning-path.md)和[排队论](../03-queueing-theory/index.md)，不能把信息熵直接当作业务复杂度或延迟指标。

首次阅读允许跳过长证明和实现细节，但要先完成各阶段自检。出现“知道术语、解释不了结果”时，回到当前例子改变一个条件，再进入下一篇；不需要先通读整个目录。
