読み方 : ぶんしょうかんるいじど

文章間類似度【sentence similarity】

概要

文章間類似度とは複数の文章の内容や意味がどの程度似ているかを数値で表した尺度。多くの場合0から1の範囲、または百分率で示され、値が大きいほど内容が近いことを意味する。人間が感覚で捉える文章の近さを、コンピュータで扱える形に置き換えたものと言える。
文章間類似度のイメージ画像

算出には、まず文章を数値の並び(ベクトル)に変換する必要がある。単語の出現回数を数える単純な方法や、目立つ単語ほど重みを大きくする方法、単語や文章の意味そのものを表す方法があり、扱う情報によって捉えられる近さの性質が異なる。

ベクトル化した後は、二つのベクトルの近さを計算して類似度を求める。代表的な手法が「コサイン類似度」(cosine similarity)であり、ベクトルの向きの一致度合いを見る。このほか、文章に含まれる単語集合の重なりから近さを求める「ジャッカード係数」(Jaccard coefficient)もよく知られている。単純な単語の一致に頼る方法では、表記が異なるが内容が近い文章を十分に捉えられない場合がある。

近年では、機械学習モデルによって文章を意味のベクトルとして表す「埋め込み」(embedding)が広く使われている。単語の並びが違っても文脈を踏まえた意味の近さを捉えられ、言い換えや語順の異なる文章同士でも適切な類似度を算出しやすくなる。深層学習を活用し、文脈や言い換え表現まで理解した上で判定するモデルも主流になりつつある。

この指標は、検索エンジンが検索語に近いページを優先して表示する機能や、内容の似たニュース記事や文書をまとめるクラスタリング、レポートや論文の盗用判定などに利用されている。チャットボットやFAQシステムでは、利用者の質問と登録済みの質問や回答との類似度を調べ、近い内容の回答を提示する処理にも用いられる。特許文書のような長い文章では、適切に分割してから類似度を算出する手法も使われている。

(2026.8.31更新)
 
この記事の著者 : (株)インセプト IT用語辞典 e-Words 編集部
1997年8月より「IT用語辞典 e-Words」を執筆・編集しています。累計公開記事数は1万ページ以上、累計サイト訪問者数は1億人以上です。学術論文や官公庁の資料などへも多数の記事が引用・参照されています。