読み方 : ぶんしょうかんるいじど
文章間類似度【sentence similarity】
概要

算出には、まず文章を数値の並び(ベクトル)に変換する必要がある。単語の出現回数を数える単純な方法や、目立つ単語ほど重みを大きくする方法、単語や文章の意味そのものを表す方法があり、扱う情報によって捉えられる近さの性質が異なる。
ベクトル化した後は、二つのベクトルの近さを計算して類似度を求める。代表的な手法が「コサイン類似度」(cosine similarity)であり、ベクトルの向きの一致度合いを見る。このほか、文章に含まれる単語集合の重なりから近さを求める「ジャッカード係数」(Jaccard coefficient)もよく知られている。単純な単語の一致に頼る方法では、表記が異なるが内容が近い文章を十分に捉えられない場合がある。
近年では、機械学習モデルによって文章を意味のベクトルとして表す「埋め込み」(embedding)が広く使われている。単語の並びが違っても文脈を踏まえた意味の近さを捉えられ、言い換えや語順の異なる文章同士でも適切な類似度を算出しやすくなる。深層学習を活用し、文脈や言い換え表現まで理解した上で判定するモデルも主流になりつつある。
この指標は、検索エンジンが検索語に近いページを優先して表示する機能や、内容の似たニュース記事や文書をまとめるクラスタリング、レポートや論文の盗用判定などに利用されている。チャットボットやFAQシステムでは、利用者の質問と登録済みの質問や回答との類似度を調べ、近い内容の回答を提示する処理にも用いられる。特許文書のような長い文章では、適切に分割してから類似度を算出する手法も使われている。
(2026.8.31更新)