---
title: 选读：条件信息与数据处理
url: https://doc.liz6.com/theory/01-information-theory/07-conditional-information-and-data-processing
locale: zh
area: theory
tags:
- 基础理论
- 信息论
date: 2026-09-08
modified: 2026-09-09
description: 选读进阶：用条件分组和状态合并，解释条件互信息为什么可增可减，以及数据处理不等式为什么必须满足马尔可夫条件。
---

# 选读：条件信息与数据处理

这篇承接[熵与信息度量](./01-entropy-and-information-measures.md)，可以在掌握联合熵、条件熵、互信息后阅读，不是进入第二篇的前置要求。全文讨论有限离散变量，使用 bit。

两个看似冲突的问题会在这里相遇：**增加一个条件，依赖可能变强；继续处理数据，却不能凭空增加信息。** 区别在于，我们究竟增加了什么可用信息，又在比较哪些变量。

## 条件互信息：在每个上下文内比较，再平均

已知 $Z$ 后，$X$ 与 $Y$ 还共享多少信息？先固定 $Z=z$，在该条件分布内计算互信息，再按上下文概率平均：

$$I(X;Y\mid Z)=\sum_zp(z)I(X;Y\mid Z=z).$$

等价地，

$$I(X;Y\mid Z)=H(Y\mid Z)-H(Y\mid X,Z).$$

第一项是已经知道上下文后的不确定性，第二项是再知道 $X$ 后的剩余量。条件互信息非负，但**它与未给定 $Z$ 时的 $I(X;Y)$ 没有固定的大小关系**。

**给定 Z 后，依赖可以增强，也可以消失**

固定四个 X、Y 组合，按 Z 筛选并重新归一化。异或例子从独立变成完全关联；共同来源例子从完全关联变成条件独立。


### 异或：整体独立，分组后却完全关联

取独立公平比特 $X,Y$，定义 $Z=X\oplus Y$。不观察 $Z$ 时，四个组合各占 $1/4$，$I(X;Y)=0$。

给定 $Z=0$，只剩 $(0,0)$ 与 $(1,1)$；给定 $Z=1$，只剩 $(0,1)$ 与 $(1,0)$。每组中单看 $Y$ 仍有 1 bit 不确定性，但知道 $X$ 就能确定 $Y$，所以每组的互信息均为 1 bit，平均也是 1 bit。

这不违背“条件熵平均不增”：这里 $H(Y\mid Z)=H(Y)=1$，而 $H(Y\mid X,Z)=0$。变化的是额外信息 $Z$ 与 $X$ 合在一起提供的预测能力，而不是凭空改变原本的样本。

### 共同来源：知道上下文后，关联不再提供额外信息

改为公平比特 $Z$，并令 $X=Y=Z$。整体上 $X,Y$ 完全相同，$I(X;Y)=1$。但给定 $Z$ 后，两者都已经确定，于是 $I(X;Y\mid Z)=0$。

这两个例子分别给出条件互信息大于和小于普通互信息的情况。不能简单地说“加条件总会减弱依赖”，也不能把两者之差直接当成一个必定非负的第三块维恩图面积。

## 数据处理：只能使用已有观测，才有这个界

若 $X\to Y\to Z$ 构成马尔可夫链，即

$$p(x,y,z)=p(x,y)p(z\mid y),$$

那么生成 $Z$ 的过程只读取 $Y$，给定 $Y$ 后不再从 $X$ 得到额外信息。此时**数据处理不等式**为

$$I(X;Z)\le I(X;Y).$$

它不要求每一步都严格丢失信息：可逆变换可以保留全部信息。也不意味着处理后的表示一定更难用；同样的信息可以被组织得更便于某个受限预测器读取，任务精度与总互信息不是同一个量。

**数据处理丢掉的信息去了哪里？**

四个等概率 X 经可逆重标记得到 Y，再保留 Y、只留奇偶或全部合并。连线显示哪些原值不可再区分，条带分解保留信息与丢失信息。


再选择一个观察到的 $Z$，尝试还原 $X$。可逆处理只留下一个候选，成功率为 1；奇偶合并留下两个等概率候选，最优成功率为 $1/2$；常量处理留下四个，成功率为 $1/4$。把结果再改名为 $W=3-Z$ 后，候选集合完全不变：只读处理结果，无法把已经合并的原值重新分开。这里的成功率是这个均匀、确定性分组例子的结论，不是仅凭互信息数值就能推出的一般公式。

图中 $Y=(X+1)\bmod4$ 是可逆重标记，完整保留 $X$ 的 2 bit。只保留 $Y$ 的奇偶性后，四种原值被分成两组，只剩 1 bit；把所有值映到常量后，剩余信息为零。丢掉的是原先能区分、现在无法区分的差异。

### 不等式的差值，正好是一项条件互信息

对同一个 $I(X;Y,Z)$，按两个不同顺序使用互信息链式法则：

$$\begin{aligned}
I(X;Y,Z)&=I(X;Y)+I(X;Z\mid Y),\\
&=I(X;Z)+I(X;Y\mid Z).
\end{aligned}$$

马尔可夫条件给出 $I(X;Z\mid Y)=0$，所以

$$I(X;Y)-I(X;Z)=I(X;Y\mid Z)\ge0.$$

右边说的是：**看过处理结果 $Z$ 后，旧观测 $Y$ 还能额外告诉我们多少关于 $X$ 的信息。** 这就是处理丢掉的部分，也是图中条带的金色部分。等号成立当且仅当这一部分为零；可逆处理是达到等号的一种充分条件，而不是唯一方式。

## 为什么 XOR 例子没有违反数据处理不等式？

在前面的 XOR 例子里，$Z$ 同时由 $X$ 与 $Y$ 计算而来，不能写成“仅从 $Y$ 生成 $Z$”的这条链。它不满足应用不等式所需的条件。

同样，如果一个处理步骤还能访问原始数据、额外的相关检索结果或其他关于 $X$ 的信息，就要把这些输入包含在观测变量里，再检查正确的马尔可夫关系。不能省去额外输入后，误判为算法违反了数据处理不等式。

| 问题 | 正确比较 |
|---|---|
| 给定额外上下文后，两变量还关联多少？ | $I(X;Y\mid Z)$；可能大于或小于 $I(X;Y)$ |
| 只处理已有观测，保留了多少原始信息？ | 在 $X\to Y\to Z$ 下，$I(X;Z)\le I(X;Y)$ |
| 处理损失了多少信息？ | 在同一条件下，差值为 $I(X;Y\mid Z)$ |

表示学习中的相关应用见[信息瓶颈](./05-rate-distortion-and-information-bottleneck.md)。连续变量涉及密度和微分熵，放在[高斯信道](./04-channel-capacity-and-coding.md)中另行介绍。

## 参考

- [MIT 6.441，第 2 章：Mutual Information](https://ocw.mit.edu/courses/6-441-information-theory-spring-2016/184197ca5d5418da2415d37e929860b9_MIT6_441S16_chapter_2.pdf)：条件互信息、条件独立与数据处理。
- Cover & Thomas，*Elements of Information Theory*，第 2 章。
