「どの特徴量が予測に本当に重要か」を知ることは、モデルを理解し、不要な特徴量を取り除くうえで 核心です。ランダムフォレストは複数の決定木を集めたモデルで、特徴量ごとの重要度も教えてくれます。 rank_features(X_train, y_train, X_test, y_test, feature_names) を完成させてください。 X_train, y_train 学習用の特徴量とラベル。 X_test, y_test 別に取り分けた評価用の特徴量とラベル。 feature_names 各列(特徴量)の名前。 ランダムフォレストを学習し、特徴量を重要な順(最も重要なものが先頭)に並べた名前のリストで 返してください。 例 ['所得', '年齢', '郵便番号'] なら、所得が最も重要という意味です。
scikit-learn のランダムフォレストを学習し、特徴量名を重要な順(最も重要なものから)に リストで返す関数を完成させる問題です。学習用と評価用の特徴量・ラベル、そして各列の名前を 受け取り、返すリストにはすべての名前がちょうど一度ずつ含まれる必要があります。どの特徴量 が予測に最も重要かを読み取る基礎を練習します。
どの特徴量が予測に本当に重要かを知ることは、モデルを理解し、役割の小さい特徴量を削るうえで 要となります。ランダムフォレストは複数の決定木をまとめたモデルで、特徴量ごとの重要度を 出せます。この問題では scikit-learn で特徴量の順位を作り、もっともらしく見える順序を うのみにせず、自分が把握しているデータで検証する練習をします。