MNISTデータベース【Modified NIST database】
概要

各データは、28×28ピクセル、256階調(8ビット)のグレースケール画像と、その画像に対応する数字のラベルが1組になっている。全体は訓練用6万件、評価用1万件の計7万件で構成され、この分割はあらかじめ固定されている。
訓練データで機械学習モデルを学習させ、評価データで未知の画像に対する認識精度を確かめるという使い方が一般的である。画像は一定の大きさや濃淡に正規化されているため、異なる手法やモデルを同じ条件で比較しやすく、画像認識アルゴリズムの標準的なベンチマークとして長年使われてきた。TensorFlowやPyTorchなど主要な機械学習ライブラリにサンプルデータとしてあらかじめ組み込まれている場合も多く、機械学習の入門教材としても定着している。
元になったのは、米国立標準技術研究所(NIST)が高校生や国勢調査局職員などから収集した手書き文字のデータである。これをAI研究者のヤン・ルカン(Yann LeCun)氏らが選別・加工し、1998年に現在の28×28ピクセル形式で公開した。それ以前の1995年には20×20ピクセル版が作られており、後に現在の形式へ改められた。データ量が小さく処理が軽量である一方、近年の高度な識別モデルでは精度が飽和しやすく、複雑な認識課題の検証には不十分とされることもある。
MNISTデータベースを拡張したデータセットとして「EMNIST」(Extended MNIST)がある。米国立標準技術研究所の手書き文字データベース「NIST Special Database 19」を基に、数字に加えてアルファベットの大文字「A」~「Z」、小文字「a」~「z」を同じ形式(手書き文字画像と正解データの組)で収録したもので、2017年に公開された。複数の種類が用意されており、最も規模の大きい「ByClass」では約81万4255件の画像データが62クラス(数字10種類とアルファベット52種類)に分類されている。詳細な利用許諾条件は明示されていないが、いずれもインターネット上で無償公開されており、研究や開発、学習を問わず誰でも自由に入手して利用できる。