教師あり学習とは
Supervised Learning
入力データと正解ラベルの対応関係を学習し、未知データのラベルを予測する機械学習の基本的な枠組み
ひとことで言うと
問題と正解のペアをたくさん見せて、新しい問題にも正しい答えを出せるように学ばせる方法。
概要
教師あり学習とは、入力とそれに対応する正解ラベル(教師信号)のペアからなるデータセットを用いて、入力から出力を予測する関数を学習する機械学習の枠組みを指す。 モデルは訓練データに対する予測と正解ラベルとの誤差(損失)を最小化するようにパラメータを更新し、未知の入力に対しても妥当な出力を予測できるよう汎化することを目指す。 出力が連続値か離散値かによって回帰と分類に大別され、線形回帰・決定木・ニューラルネットワークなど多様な手法がこの枠組みで用いられる。 画像分類やスパム判定、需要予測など、正解データを用意しやすいタスクで広く使われる代表的な学習パラダイム。
歴史
教師あり学習という枠組み自体は特定の1本の論文に起源を持つものではなく、パーセプトロン(1958年、Rosenblatt)をはじめとする初期の機械学習アルゴリズムの時代から、入力と正解の対を用いてパラメータを調整する学習方法として存在してきた。
ワークフロー
入力と正解ラベルの対からなる訓練データを用意する → モデルが入力から出力を予測する → 予測と正解ラベルの誤差を損失関数で計算する → 誤差を小さくする方向へモデルのパラメータを更新する → 検証データで汎化性能を確認しながら反復する。