12 分で読了
このページの目次

率歪みと情報ボトルネック

わずかな歪みを許容すれば、より強力に圧縮できる――率歪み理論 R(D) は、「歪み D を許容する場合に必要な最小ビット数」を示す。情報ボトルネックはこの考え方を機械学習に持ち込む: 表現 T を学習する際、入力の圧縮 I(X;T) を小さくしつつ、予測情報 I(T;Y) を大きく保つ必要がある。これは深層ネットワークの「まず記憶し、その後圧縮する」という現象を理解するための理論的枠組みとなる。

序章: 歪みを許容すれば、天井が開く

前章のソース符号化はすべて無歪み(ロスレス)であった――再構築はビット単位で完全に再現する必要があり、下限はエントロピーで固定されていた。

しかし、多くのシーンでは正確な再現は必要ない。JPEG は人間の目に敏感でない高周波の詳細を捨て、MP3 は聴覚マスキングによって隠蔽される周波数帯域を捨てる。ニューラルネットワークの中間表現も、タスクと無関係な情報を捨てる。これらは意図的な「廃棄」であり、捨ててもほとんど気づかない。

歪み(distortion) を許容できるようになると、圧縮可能な空間が急激に拡大する。同時に問題の形も変化する: 「無歪みで何ビット必要か」と問うのではなく、「許容できる歪みの上限が与えられた場合、最少で何ビット必要か?」 と問うことになる。本章ではまずこの問題(率歪み)に答え、同じ考え方を機械学習に持ち込む(情報ボトルネック)。

率歪み関数 R(D)

「歪みを許容する」ことを語るには、まず歪みを定量化する必要がある。⁠率歪み理論(rate-distortion theory) は、歪み尺度 d(x, \hat{x})(例えば二乗誤差やハミング距離)を用いて、「再構築 \hat{x} と元の x の差の大きさ」を測る。

率歪み関数 は、平均歪みが D を超えないことを保証しつつ、必要な最小ビット率として定義される。

R(D) = \min_{p(\hat{x} \mid x):\, \mathbb{E}[d]\leq D} I(X; \hat{X})

これは単調減少する曲線である: 許容する歪み D が大きければ大きいほど、必要なビット率 R は低くなる。両端の値が最も問題を示している:

  • D=0(歪み不可): 離散情報源の場合、d(x,\hat x)=0 が正確な再構築時のみ成立する場合、R(0)=H(X) となり、無歪み圧縮のエントロピー下限に後退する。連続情報源で二乗誤差を用いる場合、通常 R(0)=\infty であり、ここで H(X) を直接微分エントロプに置き換えてはならない。
  • D が十分大きく、「すべてを定数として推測しても平均的に許容できる」場合: R(D)=0 となり、1ビットも送信する必要がない。
率歪み関数 R(D): 歪みとビット数のトレードオフ曲線 D(歪み) R H(X) D=0 → R=H(X)(無歪み) D が十分大きい → R=0 到達可能領域は曲線上部: D が与えられた場合、ビット率は R(D) を下回れない

R(D) は有歪み圧縮において、エントロピーが無歪み圧縮におけるのと同様、決して超えられない理論的下界である。曲線上部は到達可能領域であり、下部は物理的に実現不可能である。

情報ボトルネックの原理

さて、この考え方を別の文脈に持ち込んでみよう。⁠情報ボトルネック(Information Bottleneck, Tishby 1999) は、率歪みを表現学習へと一般化する――ただし、「歪み」は画素誤差ではなく、「タスクに関連する情報がどれだけ失われたか」によって測られる。

設定は以下の通り: 入力 X、予測対象のラベル Y があり、中間表現 TX の某种の圧縮)を学習したい。良い T は、同時に2つの互いに牽制し合う目標を満たす必要がある:

  • 圧縮⁠: I(X;T) をできるだけ小さくする。TX に関する情報をできるだけ少なく保ち、無関係な詳細をすべて捨てる。
  • 忠実度⁠: I(T;Y) をできるだけ大きくする。TY を予測するために有用な情報をできるだけ多く保持する。

これらの2つの力をラグランジュ乗数法で統合する:

\min\ I(X;T) - \beta \cdot I(T;Y)

\beta はトレードオフのノブである: \beta が小さいと強力な圧縮を優先し、\beta が大きいと情報の保持を優先する。標準的な設定では結合分布は p(x,y)p(t\mid x) であり、マルコフ関係は Y\to X\to T(または T-X-Y)と書くべきである: X が与えられた後、TY と条件独立であり、TX から Y に関連する情報だけを抽出できる。予測時にはもちろん T を用いて Y を推定するが、「予測プロセス X\to T\to\hat Y」と「確率的依存関係 Y\to X\to T」は別の問題である。

情報ボトルネック: T は「圧縮」と「忠実度」という相反する圧力の間に挟まれる X 入力 T ボトルネック 圧縮表現 Y ラベル I(X;T) は小さく ↓ 圧縮を追求し、無関係な詳細を捨てる I(T;Y) は大きく ↑ 保持を追求し、予測情報を残す 予測プロセス: X → T → Ŷ; 確率関係: Y → X → T; 目的: min I(X;T) − β·I(T;Y)

深層ネットワークの「まず記憶し、その後圧縮する」

情報ボトルネックが注目される理由は、Tishby たちによるある観察にある。

深層ネットワークを訓練する際、各層の軌跡を (I(X;T),\ I(T;Y)) 平面上で追跡すると、しばしば2つの段階が見られる:⁠まず適合フェーズI(T;Y) が急激に上昇し、ネットワークが訓練データを「記憶」する。⁠次に圧縮フェーズI(X;T) がゆっくりと減少し、ネットワークはラベルと無関係な入力情報を押し出し、汎化性能が向上する。

これは「深層学習がなぜ汎化できるか」に対する情報理論的な視点を提供する:⁠タスクに関連する情報を保持しつつ、入力の詳細を捨てることは、汎化に役立つ可能性がある⁠。

正直に注記する必要がある: この「圧縮フェーズ」が普遍的に存在するのか、またそれが汎化の原因なのかについては、学界で依然として議論がある(ある研究では、これは活性化関数や相互情報量の推定方法に依存すると指摘している)。したがって、これを決定論ではなく示唆に富む枠組みとして捉えるべきである――それは表現の品質を情報量で記述するための言語を提供しており、それ自体が価値を持つ。

表現学習と対照的学習の接続

情報ボトルネックにおける「I(T;Y) を最大化する」という考え方は、現代の自己教師あり / 対照的学習へと直接つながる。

InfoNCE(SimCLR、CPCなどで用いられる損失関数)を例にとる: 対応する正負サンプルの構成とサンプリング仮定の下、これは相互情報 I計算可能な下限を与える。InfoNCE 損失を最小化することは、この下限を引き上げることに等価であり、表現が「何が同じものか」を区別しやすくする。ただし、下限の緩さは負サンプルの数とサンプリング方法に依存するため、損失値を直接実際の相互情報量として扱うことはできない。

さらに見ていくと、表現学習の多くの目的は、情報ボトルネックの2つの方向のいずれかで作業していることがわかる――圧縮するか、情報保持するか。ここでは InfoNCE の下限導出には立ち入らない。

フレームワーク圧縮項忠実度項下限 / 目的
率歪み R(D)\min I(X;\hat{X})歪み \mathbb{E}[d]\leq D有歪み圧縮のビット率下限
情報ボトルネック\min I(X;T)\max I(T;Y)\min I(X;T)-\beta \cdot I(T;Y)
対照的学習 (InfoNCE)明示的な IB 圧縮項は通常なし正サンプル表現の相互情報下限を引き上げる下限は負サンプルとサンプリング方法に依存

これらのツールが LLM のシーンでどのように実装されるか――パープレキシティ、RLHF における KL、スケーリング則の圧縮視点などは、LLM における情報理論に収束する。

参考文献

  • 論文⁠: "The Information Bottleneck Method" (Tishby, Pereira & Bialek, 1999 — 情報ボトルネックの原論文)
  • 論文⁠: "Opening the Black Box of Deep Neural Networks via Information" (Shwartz-Ziv & Tishby, 2017 — 適合/圧縮の2段階の観察、議論を含む)
  • 教科書⁠: "Elements of Information Theory" (Cover & Thomas — 第10章 率歪み理論)
  • 論文⁠: "Representation Learning with Contrastive Predictive Coding" (Oord et al., 2018 — InfoNCE を相互情報下限として)

キーワード: 率歪み rate-distortion, R(D) 関数, 有歪み圧縮, 情報ボトルネック Information Bottleneck, Tishby, マルコフ連鎖 Y→X→T, 圧縮と忠実度のトレードオフ, まず記憶しその後圧縮, 表現学習, InfoNCE, 対照的学習