프로젝트 목록KIM IGYEONG

COMPLETED · DATA & AI

헬스케어 데이터 분석·AI 모델링

건강검진·난임치료·유전자 변이 데이터를 바탕으로 통계 분석부터 머신러닝 분류·예측까지 수행한 부트캠프 프로젝트 모음입니다.

THREE INDEPENDENT PROJECTS

서로 다른 세 가지 헬스케어 데이터 프로젝트를 동등한 기준으로 살펴볼 수 있습니다.

01

난임치료 데이터 기반 임신 성공 여부 예측 AI

난임 시술 데이터를 구조적 피처로 변환하고, 검증 기반의 앙상블 모델로 임신 성공 여부를 예측한 프로젝트입니다.

PythonPandasNumPy
상세 보기 +
CONTEXT

수치형·범주형 변수가 혼합되고 결측값이 많은 난임 시술 데이터에서, 시술 과정과 과거 이력을 모델이 학습할 수 있는 구조로 변환해야 했습니다.

PROCESS
  1. Target 분포·결측 구조·범주별 성공률·수치 변수 효과 크기 분석
  2. 나이, 시술 유형, 난자·정자 출처, 배아 생성·이식 과정, 과거 시술 이력 기반 파생 피처 설계
  3. XGBoost·LightGBM·CatBoost·MLP 모델 실험 및 비교
  4. Stratified K-Fold와 OOF AUC 검증, Optuna 튜닝
  5. Probability·Rank ensemble·Stacking·Blending 결과 비교
TOOLS
PythonPandasNumPyScikit-learnXGBoostLightGBMCatBoostOptuna
OUTCOME

리더보드 2위, 최고 점수 0.7422198734를 기록했습니다. 내부 검증과 리더보드 결과의 차이를 비교하며 미세한 점수 변동과 과적합 가능성을 함께 검토했습니다.

NEXT

피처 그룹별 ablation study, 시술 시기 기반 holdout, SHAP·permutation importance를 활용한 모델 해석을 보완할 수 있습니다.

Notion에서 전체 기록 보기
02

유전자 변이 기반 암종 분류 예측 해커톤

6,201개 표본과 4,384개 유전자 피처에서 변이 정보를 여러 해상도로 표현하고, 26개 암종을 Macro F1 기준으로 분류한 팀 해커톤입니다.

PythonPandasNumPy
상세 보기 +
CONTEXT

희소하고 고차원적인 변이 행렬에는 클래스 불균형, 동일 변이 프로필의 상이한 라벨, 무변이 표본과 복수 변이 문자열이 함께 존재했습니다. Public Test 100%, 하루 4회 제출 제한 조건에서 리더보드에 맞춘 반복 튜닝보다 새로운 변이 프로필에도 유지되는 표현과 검증 구조를 만드는 것이 핵심 과제였습니다.

PROCESS
  1. EDA로 클래스 불균형·변이 부담·중복 프로필과 라벨 불확실성 진단
  2. 복수 변이 문자열을 보존하는 parser와 gene·type·site·exact token·burden 다중 관점 피처 설계
  3. Logistic Regression·XGBoost·LightGBM·CatBoost의 희소 선형·비선형 표현 비교
  4. Stratified CV와 Group-aware CV, fold 내부 전처리로 누수와 낙관적 검증 점검
  5. OOF 확률 기반 soft·weighted·geometric blend와 클래스별 성능 비교
  6. Driver 중심 피처 축소와 context 보완 가설을 후속 실험으로 설계
TOOLS
PythonPandasNumPyScikit-learnXGBoostLightGBMCatBoostStratified CVGroup-aware CV
OUTCOME

변이 표현 개선과 서로 다른 오류 구조를 가진 모델 조합을 통해 내부 OOF Macro F1이 기준 실험 0.4323에서 최고 관측값 0.5204까지 상승했습니다. 다만 평가 서버 최고점은 약 0.383으로 내부 검증과 차이가 있었으며, 이를 최종 일반화 성능으로 과장하지 않고 반복 가설 선택과 분포 차이 가능성을 확인한 결과로 해석했습니다.

NEXT

암종별 외부 검증 데이터가 확보되면 nested validation과 시간·기관 기반 holdout을 적용하고, driver-only 가설과 class-wise 오류 분석을 독립 검증할 예정입니다. 발현량·복제수·조직학·임상 정보가 없는 데이터 한계도 명확히 구분합니다.

03

흡연 여부 데이터 분석을 통한 건강 인사이트 도출

건강검진 데이터의 18개 지표를 흡연 여부에 따라 비교하고, 통계적 유의성과 실제 차이의 크기를 함께 해석한 데이터 분석 해커톤입니다.

PythonPandasNumPy
상세 보기 +
CONTEXT

결측치와 이상치가 많은 건강검진 데이터에서 흡연 집단과 비흡연 집단의 차이를 신뢰할 수 있게 비교해야 했습니다. 성별·운동·식습관 같은 주요 교란변수가 포함되지 않았고 일부 혈압 변수의 의미도 불명확해, 인과관계가 아닌 관찰된 연관성으로 제한해 해석하는 것이 중요했습니다.

PROCESS
  1. 데이터 구조·결측·이상치 점검과 분석 가능한 18개 건강 지표 정리
  2. 파생 변수와 기술통계를 활용한 집단별 분포·중앙값 시각화
  3. Shapiro–Wilk 검정 후 Mann–Whitney U 검정으로 비정규 분포의 집단 차이 확인
  4. 효과크기를 함께 계산해 통계적 유의성과 실질적 차이 분리
  5. 상관 분석과 표준화·교차검증을 적용한 로지스틱 회귀로 흡연 관련 지표 탐색
  6. 결과 해석, 데이터 한계와 추가 검증 방향을 발표 흐름으로 구성
TOOLS
PythonPandasNumPyMatplotlibSeabornSciPyScikit-learnLogistic Regression
OUTCOME

흡연 집단에서 헤모글로빈, 중성지방, 공복혈당이 더 높게 나타났고 통계적으로 유의한 차이를 확인했습니다. 효과크기 기준으로는 헤모글로빈의 집단 구분력이 가장 컸고 중성지방도 의미 있는 차이를 보였으며, 공복혈당은 유의했지만 실제 차이의 크기는 제한적이었습니다. 교란변수를 통제하지 못했으므로 흡연이 원인이라고 결론 내리지는 않았습니다.

NEXT

성별·연령·운동·식습관 등 교란변수를 포함한 다변량 분석과 층화 검증을 추가하고, 표본 외 데이터에서 결과가 재현되는지 확인할 예정입니다. 이후에는 해석 가능한 흡연 여부 예측 모델로 확장할 수 있습니다.