情報エントロピー【information entropy】平均情報量
概要

情報理論における情報量は、事象がどれだけ起こりにくいかを表す尺度である。発生確率が低い事象ほど観測時の情報量は大きく、確実に起こる事象の情報量は0となる。情報量は生起確率pを用いて-log₂pとして表され、単位は「ビット」(bit)である。確率が低いほど数値が大きくなる関係にある。
公平なコイントスでは、表と裏の確率がいずれも1/2である。各事象の情報量は-log₂(1/2)で1ビットとなり、確率で重み付けした平均も1ビットとなる。これがコイントスという系全体の情報エントロピーであり、結果の予測が最も困難な状態に対応する。
一方、必ず表が出るように作られたコインでは、表の確率が100%、裏の確率が0%となる。表が出ることは確実なため情報量は0ビットであり、裏は確率が0であるため寄与せず計算上0として扱われる。この場合のエントロピーも0ビットとなり、通常のコインに比べて結果の不確かさが完全に失われていることを示している。確率分布が一様に近づくほどエントロピーは増大し、その最大値は事象の取り得る状態数に依存する。
情報エントロピーはクロード・シャノン(Claude E. Shannon)が1940年代に提唱した概念である。統計力学における物体の乱雑さを表す「エントロピー」(entropy)と数式上の性質が酷似していることから、このように呼ばれる。データ圧縮や通信の分野では、情報エントロピーは平均符号長の理論的な下限を示す指標として利用される。エントロピーが高いデータは規則性が薄く、それ以上の圧縮が難しい一方、エントロピーが低いデータは偏りや重複が多く、より小さなサイズへ圧縮できる余地があることを意味する。
応用範囲は通信やデータ圧縮に留まらず、機械学習における特徴選択や決定木の分岐基準、暗号の強度評価、意思決定アルゴリズムの評価など、不確実性を扱う様々な解析手法の基礎としても用いられている。条件付き確率を導入した場合には、「条件付きエントロピー」や「相互情報量」といった概念が定義され、事象間の依存関係を記述する際に用いられる。