选读:条件信息与数据处理

本页目录

这篇承接熵与信息度量,可以在掌握联合熵、条件熵、互信息后阅读,不是进入第二篇的前置要求。全文讨论有限离散变量,使用 bit。

两个看似冲突的问题会在这里相遇:⁠增加一个条件,依赖可能变强;继续处理数据,却不能凭空增加信息。 区别在于,我们究竟增加了什么可用信息,又在比较哪些变量。

条件互信息:在每个上下文内比较,再平均

已知 后, 与 还共享多少信息?先固定 ,在该条件分布内计算互信息,再按上下文概率平均:

等价地,

第一项是已经知道上下文后的不确定性,第二项是再知道 后的剩余量。条件互信息非负,但它与未给定 时的 没有固定的大小关系⁠。

正在呈现知识画面
给定 Z 后,依赖可以增强,也可以消失

固定四个 X、Y 组合,按 Z 筛选并重新归一化。异或例子从独立变成完全关联;共同来源例子从完全关联变成条件独立。

异或:整体独立,分组后却完全关联

取独立公平比特 ,定义 。不观察 时,四个组合各占 ,。

给定 ,只剩 与 ;给定 ,只剩 与 。每组中单看 仍有 1 bit 不确定性,但知道 就能确定 ,所以每组的互信息均为 1 bit,平均也是 1 bit。

这不违背“条件熵平均不增”:这里 ,而 。变化的是额外信息 与 合在一起提供的预测能力,而不是凭空改变原本的样本。

共同来源:知道上下文后,关联不再提供额外信息

改为公平比特 ,并令 。整体上 完全相同,。但给定 后,两者都已经确定,于是 。

这两个例子分别给出条件互信息大于和小于普通互信息的情况。不能简单地说“加条件总会减弱依赖”,也不能把两者之差直接当成一个必定非负的第三块维恩图面积。

数据处理:只能使用已有观测,才有这个界

若 构成马尔可夫链,即

那么生成 的过程只读取 ,给定 后不再从 得到额外信息。此时数据处理不等式为

它不要求每一步都严格丢失信息:可逆变换可以保留全部信息。也不意味着处理后的表示一定更难用;同样的信息可以被组织得更便于某个受限预测器读取,任务精度与总互信息不是同一个量。

正在呈现知识画面
数据处理丢掉的信息去了哪里?

四个等概率 X 经可逆重标记得到 Y,再保留 Y、只留奇偶或全部合并。连线显示哪些原值不可再区分,条带分解保留信息与丢失信息。

再选择一个观察到的 ,尝试还原 。可逆处理只留下一个候选,成功率为 1;奇偶合并留下两个等概率候选,最优成功率为 ;常量处理留下四个,成功率为 。把结果再改名为 后,候选集合完全不变:只读处理结果,无法把已经合并的原值重新分开。这里的成功率是这个均匀、确定性分组例子的结论,不是仅凭互信息数值就能推出的一般公式。

图中 是可逆重标记,完整保留 的 2 bit。只保留 的奇偶性后,四种原值被分成两组,只剩 1 bit;把所有值映到常量后,剩余信息为零。丢掉的是原先能区分、现在无法区分的差异。

不等式的差值,正好是一项条件互信息

对同一个 ,按两个不同顺序使用互信息链式法则:

马尔可夫条件给出 ,所以

右边说的是:⁠看过处理结果 后,旧观测 还能额外告诉我们多少关于 的信息。 这就是处理丢掉的部分,也是图中条带的金色部分。等号成立当且仅当这一部分为零;可逆处理是达到等号的一种充分条件,而不是唯一方式。

为什么 XOR 例子没有违反数据处理不等式?

在前面的 XOR 例子里, 同时由 与 计算而来,不能写成“仅从 生成 ”的这条链。它不满足应用不等式所需的条件。

同样,如果一个处理步骤还能访问原始数据、额外的相关检索结果或其他关于 的信息,就要把这些输入包含在观测变量里,再检查正确的马尔可夫关系。不能省去额外输入后,误判为算法违反了数据处理不等式。

问题正确比较
给定额外上下文后,两变量还关联多少?;可能大于或小于
只处理已有观测,保留了多少原始信息?在 下,
处理损失了多少信息?在同一条件下,差值为

表示学习中的相关应用见信息瓶颈。连续变量涉及密度和微分熵,放在高斯信道中另行介绍。

参考