어떤 메일이 스팸일 확률, 어떤 거래가 사기일 확률처럼, 분류 모델은 "예/아니오"만이 아니라 "양성일 확률"을 함께 주면 훨씬 쓸모가 커요. 확률이 있으면 상황에 맞게 기준선(threshold)을 조절해서 더 조심스럽게 또는 더 너그럽게 판단할 수 있거든요. positive_proba(X_train, y_train, X_test) 를 완성하세요. 라벨은 0(음성)과 1(양성) 두 가지예요. 로지스틱 회귀를 학습해서, X_test 각 샘플이 양성(라벨 1)일 확률을 1차원 배열로 돌려주세요. 예시 확실히 양성인 샘플은 1 에 가까운 값, 확실히 음성인 샘플은 0 에 가까운 값이 나옵니다.
scikit-learn 로지스틱 회귀로, 새 데이터의 각 행이 양성(라벨이 1)인지의 확률을, 값이 한 줄로 늘어선 1차원 배열에 담아 돌려주는 함수를 완성하는 문제입니다. 라벨은 0 과 1 두 가지, 학습은 학습 데이터로만 하고, 모든 값은 0 과 1 사이여야 합니다. 분류 모델을 확률 출력으로 바꾸는 기본기를 연습합니다.
분류 모델은 "예/아니오"만이 아니라 양성일 확률까지 함께 주면 훨씬 쓸모가 커집니다. 확률이 있으면 상황에 맞게 판단 기준선을 더 조심스럽게 또는 더 너그럽게 조절할 수 있기 때문입니다. 로지스틱 회귀는 그런 확률을 scikit-learn 으로 만드는 대표적인 방법입니다. 이 문제는 그 확률 출력을 만들고, 한눈에 믿기보다 실제 샘플로 검증하는 습관을 연습합니다.