勾配ブースティングとは
Gradient Boosting / GBM
弱い予測モデルを1つずつ順番に追加し、直前までの予測誤差を勾配降下法的に修正しながら精度を高めるアンサンブル学習手法
ひとことで言うと
簡単な予測モデルを少しずつ追加し、間違いを修正しながら精度を上げていく機械学習手法。
概要
勾配ブースティングとは、決定木のような単純な(弱い)予測モデルを1本ずつ順番に学習・追加していき、それまでのモデル全体の予測誤差を新しいモデルで補正することを繰り返すアンサンブル学習の手法。 各ステップで、損失関数の勾配を最も減少させる方向に新しい弱学習器を学習させ、それを既存モデルへ重み付きで加算していく点が、勾配降下法の考え方に対応する。 XGBoost・LightGBM・CatBoostといった実装が、表形式データを扱うタスクで高い予測精度を発揮する手法として広く使われている。
背景
単体の決定木は表現力が限られ、ランダムフォレストのように複数の木を独立に学習させる手法では、個々の木の誤りを直接補正する仕組みがなかった。 勾配ブースティングは、モデル全体の予測誤差を明示的に評価し、それを埋めるように次の弱学習器を追加していくことで、より高い精度を目指すために考案された。
歴史
1999年: Jerome Friedmanが、損失関数の勾配を利用して弱学習器を逐次追加するGradient Boosting Machineを提案。 2016年: ChenとGuestrinが、勾配ブースティングを高速化・正則化したXGBoostを発表し、機械学習コンペティションで広く使われる標準的な手法となる。
利点
- 表形式データに対して、多くの場合で高い予測精度を発揮する
- 損失関数を柔軟に設計でき、分類・回帰など多様なタスクに適用できる
欠点
比較
関連用語
参考文献
- Research PaperXGBoost: A Scalable Tree Boosting System