특징이 수십 개면 한눈에 보기 어려워요. PCA 는 데이터가 가장 많이 퍼진 방향 몇 개를 찾아 그 방향으로 데이터를 요약해, 적은 수의 축으로 줄이는 방법이에요. 줄인 축 몇 개가 원래 정보를 얼마나 담는지(분산 비율)를 보면, 몇 개로 줄여도 될지 가늠할 수 있어요. variance_ratio_2d(X) 를 완성하세요. X 는 행이 데이터, 열이 특징인 2차원 실수 배열이에요. PCA 로 2개 주성분을 뽑아, 그 두 주성분이 각각 설명하는 분산 비율을 길이 2 배열로 돌려주세요. 예시 [0.7, 0.2] 면 첫 축이 70%, 둘째 축이 20% 의 분산을 담는다는 뜻이에요.
scikit-learn PCA 로 2차원 특징 배열에서 주성분 2개를 뽑아, 각 성분의 설명 분산 비율을 큰 값부터 차례로 원소 두 개짜리 배열에 담아 돌려주는 함수를 완성하는 문제입니다. 여러 특징을 몇 개의 방향으로 요약하는 차원 축소와, 그 몇 개의 축이 원래 정보를 얼마나 담는지 읽어내는 기본기를 연습합니다.
PCA 는 자료가 가장 넓게 퍼지는 몇 개의 방향을 찾아 그 위로 자료를 요약하고, 설명 분산 비율은 그 축들이 원래 정보를 얼마나 담는지 알려줍니다. 이 문제는 scikit-learn 으로 성분을 뽑고, 그럴듯해 보이는 결과를 그냥 믿기보다 분산 비율을 실제 숫자로 검증하는 연습을 합니다.