Re Reference AI

技術

ランダムフォレストとは

Random Forest

多数の決定木をランダムな条件下で学習させ、それらの予測を多数決・平均で統合するアンサンブル学習手法

機械学習分類

ひとことで言うと

たくさんの決定木の予測をまとめて多数決する、精度の高い機械学習モデル。

概要

ランダムフォレストとは、学習データと特徴量の両方をランダムに抽出しながら多数の決定木を学習させ、それぞれの予測結果を多数決(分類の場合)または平均(回帰の場合)で統合するアンサンブル学習手法。 個々の決定木は学習データの一部(ブートストラップサンプル)と特徴量の一部のみを使って学習するため、木同士の予測が互いに独立しやすくなる。 単体の決定木で起きやすい過学習を抑えつつ、高い予測性能を実現する手法として広く使われている。

背景

単体の決定木は学習データのわずかな変化にも敏感で、過学習を起こしやすいという弱点があった。 ランダムフォレストは、多数の決定木をあえてランダムにばらつかせて学習し、その予測を組み合わせることでこの不安定さを緩和するために考案された。

歴史

2001年: Leo Breimanが、決定木にバギング(ブートストラップ集約)と特徴量のランダム選択を組み合わせたランダムフォレストを提案する論文を発表。

利点

  • 単体の決定木と比べて過学習しにくく、汎化性能が高い
  • 特徴量のスケーリング等の前処理が比較的不要で扱いやすい

欠点

  • 多数の決定木を保持するため、単体の決定木と比べてモデルサイズが大きく推論も遅い
  • 個々の決定木の判断根拠は追えても、多数決全体としての説明性は単体の決定木より劣る

比較

  • 決定木ランダムフォレストは、多数の決定木を組み合わせて過学習を抑えるアンサンブル学習の代表的手法
  • 勾配ブースティングランダムフォレストが多数の決定木を並列に学習させるのに対し、勾配ブースティングは決定木を順番に追加しながら誤りを修正していく

関連用語

決定木勾配ブースティングアンサンブル学習

参考文献

関連Zenn記事