ランダムフォレストとは
Random Forest
多数の決定木をランダムな条件下で学習させ、それらの予測を多数決・平均で統合するアンサンブル学習手法
ひとことで言うと
概要
ランダムフォレストとは、学習データと特徴量の両方をランダムに抽出しながら多数の決定木を学習させ、それぞれの予測結果を多数決(分類の場合)または平均(回帰の場合)で統合するアンサンブル学習手法。 個々の決定木は学習データの一部(ブートストラップサンプル)と特徴量の一部のみを使って学習するため、木同士の予測が互いに独立しやすくなる。 単体の決定木で起きやすい過学習を抑えつつ、高い予測性能を実現する手法として広く使われている。
背景
単体の決定木は学習データのわずかな変化にも敏感で、過学習を起こしやすいという弱点があった。 ランダムフォレストは、多数の決定木をあえてランダムにばらつかせて学習し、その予測を組み合わせることでこの不安定さを緩和するために考案された。
歴史
2001年: Leo Breimanが、決定木にバギング(ブートストラップ集約)と特徴量のランダム選択を組み合わせたランダムフォレストを提案する論文を発表。
利点
欠点
比較
関連用語
参考文献
- Research PaperRandom Forests