"어떤 특징이 예측에 정말 중요한가"는 모델을 이해하고 쓸데없는 특징을 걷어내는 데 핵심이에요. 랜덤포레스트는 여러 결정 나무를 모은 모델인데, 특징별 중요도도 함께 알려줘요. rank_features(X_train, y_train, X_test, y_test, feature_names) 를 완성하세요. X_train, y_train 학습용 특징과 라벨. X_test, y_test 따로 떼어 둔 평가용 특징과 라벨. feature_names 각 열(특징)의 이름. 랜덤포레스트를 학습해, 특징을 중요한 순서(가장 중요한 것이 앞)대로 이름 리스트로 돌려주세요. 예시 ['소득', '나이', '우편번호'] 면 소득이 가장 중요하다는 뜻이에요.
scikit-learn 랜덤 포레스트를 학습해, 특징 이름을 중요한 순서대로(가장 중요한 것부터) 리스트로 돌려주는 함수를 완성하는 문제입니다. 학습용과 평가용 특징·라벨, 그리고 각 열의 이름을 받고, 돌려주는 리스트에는 모든 이름이 정확히 한 번씩 들어가야 합니다. 어떤 특징이 예측에 가장 중요한지 읽어내는 기본기를 연습합니다.
어떤 특징이 예측에 정말 중요한지 아는 것은 모델을 이해하고, 제 몫을 못 하는 특징을 덜어내는 데 핵심입니다. 랜덤 포레스트는 여러 결정 트리를 모은 모델이고, 특징별 중요도를 낼 수 있습니다. 이 문제는 scikit-learn 으로 특징 순위를 만들고, 그럴듯해 보이는 순서를 그냥 믿기보다 내가 아는 데이터로 검증하는 연습을 합니다.