読み方 : けんしょうデータ

検証データ【validation data】

概要

検証データとは機械学習でモデルを構築する際、性能の確認やハイパーパラメータの調整に用いるデータのこと。学習には使わず、学習データテストデータの中間段階で、モデルが未知のデータにどの程度対応できるかを確かめるために利用される。
検証データのイメージ画像

機械学習では通常、手元のデータセット学習データ、検証データ、テストデータの3種類に分割して用いる。学習データでモデルにパターンを学習させ、検証データで性能や設定を確認し、最後にテストデータで未知のデータに対する最終的な性能を評価するという流れが一般的である。

学習データに対する精度が高くても、実際の未知データに正しく対応できるとは限らない。学習データの特徴を過剰に反映してしまう「過学習」(overfitting)と呼ばれる現象が起こるためである。そこで学習には使っていない検証データを用いて予測を行わせ、正答率やF1スコア、RMSEなどの指標で結果を確認することで、過学習の兆候を捉えられる。

検証データは、モデルの層の数や学習率といったハイパーパラメータの調整や、複数のモデルを比較して選ぶ際にも使われる。評価結果が不十分であれば設定を変更し、再び学習と評価を行うという工程を繰り返しながら、モデルを少しずつ改善していく。学習データのみで評価すると、そのデータへの適合度が高いだけの設定を選んでしまう恐れがあるため、別に確保した検証データを使うことに意味がある。

ここで注意すべきは、検証データとテストデータの役割の違いである。検証データは調整のために繰り返し参照されるのに対し、テストデータはすべての調整が完了した後、最終的な性能を一度だけ測定するために使われる。検証データを繰り返し使い続けると、今度はそのデータに対してモデルが過度に適応してしまうことがあるため、テストデータは検証データとは別に用意し、最後まで結果を確認しない運用が定着している。学習、検証、テストの各データが重複しないようにすることも重要である。

検証データを固定的に用意する代わりに、「交差検証」という手法を使う場合もある。代表的な「k分割交差検証」では、データを複数の部分に分け、そのうち一つを検証用、残りを学習用として使う処理を入れ替えながら繰り返し、得られた評価値を比較する。手元のデータ量が限られている場合などに用いられる方法である。

(2026.8.29更新)
 
この記事の著者 : (株)インセプト IT用語辞典 e-Words 編集部
1997年8月より「IT用語辞典 e-Words」を執筆・編集しています。累計公開記事数は1万ページ以上、累計サイト訪問者数は1億人以上です。学術論文や官公庁の資料などへも多数の記事が引用・参照されています。