特徴量が数十個あると一目で見るのは難しいです。PCA はデータが最も大きく広がる方向をいくつか 見つけ、その方向でデータを要約して、少数の軸に減らす方法です。減らした軸が元の情報をどれだけ 保つか(分散比率)を見れば、いくつまで減らせるか見当がつきます。 variance_ratio_2d(X) を完成させてください。X は行がデータ、列が特徴量の2次元実数配列です。 PCA で2つの主成分を取り出し、その二つの主成分がそれぞれ説明する分散の割合を長さ2の配列で 返してください。 例 [0.7, 0.2] なら、一つ目の軸が 70%、二つ目の軸が 20% の分散を保つという意味です。
scikit-learn の PCA で2次元の特徴量配列から主成分を2つ抽出し、各成分の説明分散比率を 大きい順に長さ2の配列で返す関数を完成させる問題です。多くの特徴量をいくつかの方向に まとめる次元削減と、その少数の軸が元の情報をどれだけ保つかを読み取る基礎を練習します。
PCA はデータが最も広がる方向をいくつか見つけ、その上にデータをまとめます。説明分散比率は その軸が元の情報をどれだけ保つかを教えてくれます。この問題では scikit-learn で成分を抽出し、 もっともらしく見える結果をうのみにせず、分散比率を実際の数値で検証する練習をします。