---
title: 上級読解：条件付き情報とデータ処理
url: https://doc.liz6.com/ja/theory/01-information-theory/07-conditional-information-and-data-processing
locale: ja
area: theory
tags:
- 基礎理論
- 情報理論
date: 2026-09-08
modified: 2026-09-09
description: 上級読解：条件によるグループ分けと状態の統合を用い、なぜ条件付き相互情報量が増減し得るか、またなぜデータ処理不等式がマルコフ条件を満たす必要があるかを説明する。
---

# 上級読解：条件付き情報とデータ処理

この章は[エントロピーと情報の尺度](./01-entropy-and-information-measures.md)に続き、結合エントロピー、条件付きエントロピー、相互情報量を理解した後に読むことができる。第2章への必須前提条件ではない。本文では有限離散変数を扱い、単位は bit を使用する。

一見すると矛盾する2つの問題がここで出会う。**条件を加えると依存関係が強くなる可能性があるが、データを処理しても情報が凭空（無から）に増えることはない。** 違いは、我々がどのような利用可能な情報を加えたのか、そしてどの変数同士を比較しているのかという点にある。

## 条件付き相互情報文：各文脈内で比較し、平均化する

$Z$ が既知のとき、$X$ と $Y$ はどの程度の情報を共有しているか？まず $Z=z$ を固定し、その条件付き分布内で相互情報量を計算し、その後文脈の確率で平均化する：

$$I(X;Y\mid Z)=\sum_zp(z)I(X;Y\mid Z=z).$$

同様に、

$$I(X;Y\mid Z)=H(Y\mid Z)-H(Y\mid X,Z).$$

第1項は文脈を既知としたあとの不確実性であり、第2項は $X$ も既知としたあとの残存量である。条件付き相互情報量は非負だが、**$Z$ が与えられていない場合の $I(X;Y)$ との間に固定された大小関係はない**。

**Z が与えられると、依存関係は強化も消滅もする**

4つのX、Yの組み合わせを固定し、Zでフィルタリングして再正規化する。XOR（排他的論理和）の例では独立から完全相関に、共通源の例では完全相関から条件付き独立になる。


### XOR：全体では独立だが、グループ分けされると完全相関

独立な公平なビット $X,Y$ を取り、$Z=X\oplus Y$ と定義する。$Z$ を観察しない場合、4つの組み合わせはそれぞれ $1/4$ の確率を持ち、$I(X;Y)=0$ である。

$Z=0$ が与えられると、$(0,0)$ と $(1,1)$ のみが残る。$Z=1$ が与えられると、$(0,1)$ と $(1,0)$ のみが残る。各グループにおいて $Y$ 単独では 1 bit の不確実性が残るが、$X$ が分かれば $Y$ が確定するため、各グループの相互情報量は 1 bit であり、平均も 1 bit となる。

これは「条件付きエントロピーは平均で減少しない」という事実と矛盾しない。ここで $H(Y\mid Z)=H(Y)=1$ であり、$H(Y\mid X,Z)=0$ である。変化しているのは、追加情報 $Z$ が $X$ と組み合わさって提供する予測能力であり、元のサンプルを凭空に変化させているわけではない。

### 共通源：文脈を知ると、相関は追加情報をもたらさない

公平なビット $Z$ を取り、$X=Y=Z$ とする。全体として $X,Y$ は完全に同一であり、$I(X;Y)=1$ である。しかし、$Z$ が与えられると両方が確定するため、$I(X;Y\mid Z)=0$ となる。

これらの2つの例は、それぞれ条件付き相互情報量が通常の相互情報量より大きい場合と小さい場合を示している。「条件を加えると依存関係が常に弱まる」と単純に言うことはできず、両者の差を必ず非負の第3のベイン図の面積と見なすこともできない。

## データ処理：既存の観測のみを使用する場合にのみ、この境界が成り立つ

$X\to Y\to Z$ がマルコフ連鎖を形成する場合、すなわち

$$p(x,y,z)=p(x,y)p(z\mid y),$$

であれば、$Z$ を生成するプロセスは $Y$ のみを参照し、$Y$ が与えられた時点で $X$ から追加の情報を受け取らない。このとき**データ処理不等式**は

$$I(X;Z)\le I(X;Y).$$

となる。

これは各ステップで厳密な情報の損失が必要であることを意味しない。可逆変換はすべての情報を保持できる。また、処理後の表現が必ずしも使いにくいことを意味するものでもない。同じ情報を、制限のある予測子が読み取りやすいように整理できる場合があり、タスクの精度と総相互情報量は同じ尺度ではない。

**データ処理で失われた情報はどこへ？**

4つの等確率のXが可逆な再ラベリングを経てYになり、さらにYを保持して奇偶のみを残すか、すべてをマージする。線はどの元の値が区別できなくなったかを示し、ストリップ分解は保持情報と損失情報を示す。


観測された $Z$ をもう1つ選び、$X$ の復元を試みる。可逆処理は候補を1つだけ残し、成功率は 1 である。奇偶マージは2つの等確率の候補を残し、最適な成功率は $1/2$ である。定数処理は4つを残し、成功率は $1/4$ である。結果を $W=3-Z$ と再命名しても、候補集合は完全に不変である。処理結果のみを読み取れば、すでにマージされた元の値を再び分離することはできない。ここでの成功率は、この一様で決定論的なグループ分けの例における結論であり、相互情報量の数値のみから導き出される一般的な公式ではない。

図において $Y=(X+1)\bmod4$ は可逆な再ラベリングであり、$X$ の 2 bit を完全に保持する。$Y$ の奇偶性のみを保持すると、4つの元の値は2つのグループに分けられ、1 bit のみが残る。すべての値を定数に写像すると、残存情報はゼロになる。失われたのは、以前は区別可能だったが、現在は区別できない差異である。

### 不等式の差は、ちょうど1つの条件付き相互情報量に等しい

同じ $I(X;Y,Z)$ に対して、2つの異なる順序で相互情報量の連鎖則を使用する：

$$\begin{aligned}
I(X;Y,Z)&=I(X;Y)+I(X;Z\mid Y),\\
&=I(X;Z)+I(X;Y\mid Z).
\end{aligned}$$

マルコフ条件により $I(X;Z\mid Y)=0$ であるため、

$$I(X;Y)-I(X;Z)=I(X;Y\mid Z)\ge0.$$

右辺が示すのは：**処理結果 $Z$ を見た後、古い観測 $Y$ が $X$ についてさらにどの程度の情報を教えてくれるかである。** これが処理で失われた部分であり、図におけるストリップの金色の部分である。等号が成立するのは、この部分がゼロの場合のみである。可逆処理は等号を満たす十分条件の一つであるが、唯一の方法ではない。

## なぜ XOR の例はデータ処理不等式に違反しないのか？

前述の XOR の例では、$Z$ は $X$ と $Y$ の両方から計算されており、「$Y$ のみから $Z$ を生成する」という連鎖には書けない。これは不等式を適用するために必要な条件を満たしていない。

同様に、処理ステップが元のデータ、追加の関連検索結果、または $X$ に関する他の情報にアクセスできる場合、これらの入力を観測変数に含め、正しいマルコフ関係を再確認する必要がある。追加入力を省略した状態で、アルゴリズムがデータ処理不等式に違反していると誤判断してはならない。

| 問題 | 正しい比較 |
|---|---|
| 追加の文脈が与えられた後、2変数の間に相関は残っているか？ | $I(X;Y\mid Z)$；$I(X;Y)$ より大きくなったり小さくなったりする可能性がある |
| 既存の観測のみを処理し、元の情報をどれだけ保持したか？ | $X\to Y\to Z$ の下で、$I(X;Z)\le I(X;Y)$ |
| 処理によってどれだけの情報が失われたか？ | 同じ条件下で、差は $I(X;Y\mid Z)$ である |

表現学習における関連する応用については[情報ボトルネック](./05-rate-distortion-and-information-bottleneck.md)を参照のこと。連続変数については密度と微分エントロピーが含まれるため、[ガウスチャネル](./04-channel-capacity-and-coding.md)で別途紹介する。

## 参考文献

- [MIT 6.441、第2章：Mutual Information](https://ocw.mit.edu/courses/6-441-information-theory-spring-2016/184197ca5d5418da2415d37e929860b9_MIT6_441S16_chapter_2.pdf)：条件付き相互情報量、条件付き独立、およびデータ処理。
- Cover & Thomas、*Elements of Information Theory*、第2章。
