読み方 : ちょうふくはいじょ

重複排除【deduplication】デデュープ/デデュプリケーション

概要

重複排除とはストレージ内に存在する同一のデータを探し出し、一つを残して他を削除することで記憶容量を節約する技術。削除箇所には残したデータへの参照情報を書き込み、利用者はデータの消去を意識せず通常通りに扱える。
重複排除のイメージ画像

重複排除では複数個所に存在する同一のデータを一つだけ残して削除し、削除した箇所に残したデータの格納アドレスなどの参照情報を書き込む。そのデータが必要になった際はシステムが自動的に参照先から読み込むため、見かけ上はデータが保持されたままの状態に保たれる。

一般にコンピュータに保管されるデータは、同じ内容が複数箇所に複製されていたり、異なるファイル間でも部分的に共通している箇所が少なくない。重複排除を適用することで必要な記憶容量を大幅に削減でき、企業の業務データでは数分の一から数十分の一に削減できた事例もある。

重複の検出と削除はファイル単位、固定長ブロック単位、可変長ブロック単位の三方式に大別される。ファイル単位は処理が単純だが、一部しか共通しない場合は削減できない。固定長ブロック単位や可変長ブロック(チャンクセグメントとも呼ばれる)単位は、ファイルをまたいだ部分的な重複も検出できるため削減効果が高い一方、処理は複雑で時間もかかる。重複の判定には、データを逐一比較する代わりにハッシュ値を用いて同一性を効率よく判定する手法が用いられることが多い。

書き込みのタイミングによる分類もある。データの書き込み前にリアルタイムで重複を検出する「インライン方式」と、一度書き込んだ後にまとめて処理する「ポストプロセス方式」があり、処理性能や必要な記憶領域との兼ね合いで使い分けられる。

重複排除はバックアップシステムでとりわけ活用されている。バックアップでは世代をまたいで同一・類似データが繰り返し保存されることになるため、重複排除による容量圧縮効果が極めて有効に機能する。また、クラウドストレージやエンタープライズ向けストレージ製品でも標準的に搭載され、データ転送量の削減にも寄与する。データ圧縮と併用されることも多いが、圧縮データの表現形式を変えて容量を削減するのに対し、重複排除は同じ内容を一度しか保存しないことで容量を削減する点で異なる。

(2026.7.13更新)
 

他の辞典等による「重複排除」の解説 (外部サイト)

この記事の著者 : (株)インセプト IT用語辞典 e-Words 編集部
1997年8月より「IT用語辞典 e-Words」を執筆・編集しています。累計公開記事数は1万ページ以上、累計サイト訪問者数は1億人以上です。学術論文や官公庁の資料などへも多数の記事が引用・参照されています。