<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Healthcare | Sieun Kim Portfolio</title><link>https://siuunni.github.io/tags/healthcare/</link><atom:link href="https://siuunni.github.io/tags/healthcare/index.xml" rel="self" type="application/rss+xml"/><description>Healthcare</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>ko-kr</language><lastBuildDate>Sat, 06 Dec 2025 00:00:00 +0000</lastBuildDate><image><url>https://siuunni.github.io/media/icon_hu_1c0e9cb08cfb822a.png</url><title>Healthcare</title><link>https://siuunni.github.io/tags/healthcare/</link></image><item><title>LG Aimers 6기: 난임 시술 임신 성공률 예측</title><link>https://siuunni.github.io/projects/lg-aimers/</link><pubDate>Sat, 06 Dec 2025 00:00:00 +0000</pubDate><guid>https://siuunni.github.io/projects/lg-aimers/</guid><description>&lt;div style="display:grid;grid-template-columns:130px 1fr;gap:1rem 1.5rem;margin-bottom:2rem;"&gt;
&lt;div style="font-weight:700;"&gt;개요&lt;/div&gt;
&lt;div&gt;난임 환자 시술 데이터로 임신 성공을 예측하는 LG Aimers 6기 해커톤 프로젝트입니다. 예선과 본선의 평가 방식 차이에 맞춰 모델 전략을 다르게 설계했습니다.&lt;/div&gt;
&lt;div style="font-weight:700;"&gt;대회&lt;/div&gt;
&lt;div&gt;LG Aimers 6기 — 난임 환자 대상 임신 성공 예측 AI 온라인 해커톤 (팀 간지포s)&lt;/div&gt;
&lt;div style="font-weight:700;"&gt;기간&lt;/div&gt;
&lt;div&gt;2024.01 ~ 2024.05&lt;/div&gt;
&lt;div style="font-weight:700;"&gt;데이터&lt;/div&gt;
&lt;div&gt;난임 환자 IVF(체외수정) 시술 데이터 (배아·난자 상태, 연령, 시술 이력 등)&lt;/div&gt;
&lt;div style="font-weight:700;"&gt;기술 스택&lt;/div&gt;
&lt;div&gt;Python · CatBoost · LightGBM · AutoGluon · Optuna · scikit-learn · pandas&lt;/div&gt;
&lt;div style="font-weight:700;"&gt;성과&lt;/div&gt;
&lt;div&gt;&lt;strong&gt;예선 0.70 → 0.74&lt;/strong&gt;로 본선 진출, &lt;strong&gt;본선 0.64 → 0.66&lt;/strong&gt; 개선, &lt;strong&gt;최종 7위&lt;/strong&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;hr&gt;
&lt;h2 id="문제-정의"&gt;문제 정의&lt;/h2&gt;
&lt;p&gt;난임 환자의 IVF 시술 데이터를 바탕으로 &lt;strong&gt;임신 성공&lt;/strong&gt;을 예측하는 과제입니다. 정밀한 예측은 의료진의 임상 의사결정과 환자 상담을 보조할 수 있습니다.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;예선과 본선의 예측 대상(target)과 평가 방식이 달라&lt;/strong&gt;, 이에 맞춰 모델링 전략을 완전히 다르게 가져갔습니다.&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th style="text-align: left"&gt;&lt;/th&gt;
&lt;th style="text-align: left"&gt;예선&lt;/th&gt;
&lt;th style="text-align: left"&gt;본선&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;&lt;strong&gt;예측 대상&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: left"&gt;임신 성공 &lt;strong&gt;여부 (0 또는 1)&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: left"&gt;임신 성공 &lt;strong&gt;확률 (0~1 연속값)&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;&lt;strong&gt;문제 유형&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: left"&gt;이진 분류&lt;/td&gt;
&lt;td style="text-align: left"&gt;확률 회귀&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;&lt;strong&gt;평가 지표&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: left"&gt;ROC-AUC&lt;/td&gt;
&lt;td style="text-align: left"&gt;Weighted Brier + F1 혼합 Score&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;&lt;strong&gt;핵심 전략&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: left"&gt;CatBoost + AutoGluon 앙상블&lt;/td&gt;
&lt;td style="text-align: left"&gt;가중치 손실 설계 + Stacking&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr&gt;
&lt;h2 id="공통--데이터-전처리--파생변수"&gt;공통 — 데이터 전처리 &amp;amp; 파생변수&lt;/h2&gt;
&lt;p&gt;두 라운드 모두 의미 있는 파생변수 설계에 집중했습니다.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;문자열 → 수치 변환:&lt;/strong&gt; &lt;code&gt;&amp;quot;0회&amp;quot;&lt;/code&gt;, &lt;code&gt;&amp;quot;1-5회&amp;quot;&lt;/code&gt;, &lt;code&gt;&amp;quot;&amp;gt;20&amp;quot;&lt;/code&gt;, &lt;code&gt;&amp;quot;6회 이상&amp;quot;&lt;/code&gt; 같은 범위형 문자열을 중앙값 추정 또는 기준값+1 방식으로 수치화했습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;결측치 처리:&lt;/strong&gt; NaN을 대체하고 결측 존재 여부 플래그를 추가했습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;비율·상호작용 변수:&lt;/strong&gt; 단순 수치 대신 의미 있는 파생변수를 생성했습니다.
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;배아 관련:&lt;/strong&gt; 배아 이식 비율, ICSI(미세주입) 배아 비율, 배아 저장 비율, 배아 품질 지표&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;난자 관련:&lt;/strong&gt; 난자 수정시도 비율, 난자 배아 생성 성공률, 신선/해동 난자 여부&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;시술·연령 관련:&lt;/strong&gt; 이전 시술 총 횟수, 시술 경험 점수, 고위험 연령군, 연령 가중치, 이식 후 적정기간&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;상관관계 분석으로 임신 성공에 유의미한 핵심 변수를 선별했습니다.&lt;/p&gt;
&lt;figure style="margin:1.5rem 0;"&gt;
&lt;img src="https://siuunni.github.io/uploads/papers/lg_correlation.png"
alt="임신 성공 확률과 상관관계가 높은 상위 30개 변수"
style="width:100%;border-radius:8px;border:1px solid rgba(148,163,184,.25);background:#fff;padding:.5rem;"&gt;
&lt;figcaption style="font-size:.8rem;color:#94a3b8;margin-top:.5rem;text-align:center;"&gt;
임신 성공 확률과의 상관계수 상위 30개 변수 (초록: 양의 상관, 빨강: 음의 상관)
&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;hr&gt;
&lt;h2 id="예선--임신-성공-여부-이진-분류"&gt;예선 — 임신 성공 여부 (이진 분류)&lt;/h2&gt;
&lt;p&gt;예선은 임신 성공을 &lt;strong&gt;0/1 이진 분류&lt;/strong&gt;로 예측하고 &lt;strong&gt;ROC-AUC&lt;/strong&gt;로 평가했습니다.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;CatBoost + Optuna:&lt;/strong&gt; 범주형 변수 처리에 강한 CatBoost를 사용하고, Optuna로 8개 하이퍼파라미터를 Stratified 5-Fold 교차검증 기반으로 튜닝했습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;AutoGluon:&lt;/strong&gt; TabularPredictor로 다양한 모델을 자동 탐색(HPO)해 예측 확률을 얻었습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Weighted mean 앙상블:&lt;/strong&gt; 두 모델의 예측을 가중평균해 최종 확률을 산출했습니다.&lt;/li&gt;
&lt;/ul&gt;
$$\hat{y} = \frac{\text{CatBoost} + 2 \times \text{AutoGluon}}{3}$$&lt;p&gt;→ 단일 모델 대비 앙상블로 &lt;strong&gt;점수 0.70에서 0.74로 향상&lt;/strong&gt;, 본선에 진출했습니다.&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="본선--임신-성공-확률-회귀"&gt;본선 — 임신 성공 확률 (회귀)&lt;/h2&gt;
&lt;p&gt;본선은 임신 성공을 &lt;strong&gt;0~1 사이 연속 확률&lt;/strong&gt;로 예측해야 했고, &lt;strong&gt;평가 지표 자체가 바뀌었습니다.&lt;/strong&gt; 단순 정밀도가 아니라 &lt;strong&gt;확률 정확도(Weighted Brier)와 이진 분류 성능(F1)을 절반씩 섞은 점수&lt;/strong&gt;였습니다.&lt;/p&gt;
$$\text{Score} = 0.5 \times \left(1 - \frac{\sum w_i (y_i - \hat{y}_i)^2}{\sum w_i}\right) + 0.5 \times \frac{2TP}{2TP + FP + FN}$$&lt;p&gt;이 지표에 맞춰 두 가지 전략을 새로 설계했습니다.&lt;/p&gt;
&lt;h3 id="1-가중치-기반-손실-설계"&gt;1. 가중치 기반 손실 설계&lt;/h3&gt;
&lt;p&gt;평가식의 가중치 $w_i = 1 + 4y_i + (0.5 - y_i)^2$ 를 학습 손실에 반영해, &lt;strong&gt;임상적으로 중요한 임신 성공(희귀 클래스) 케이스에 더 민감하게&lt;/strong&gt; 반응하도록 유도했습니다. 예측값은 확률로 출력 가능하도록 Calibration 친화적인 모델을 사용했습니다.&lt;/p&gt;
&lt;h3 id="2-catboost--lightgbm-stacking"&gt;2. CatBoost + LightGBM Stacking&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Stage 1:&lt;/strong&gt; CatBoost로 예측값과 잔차(residual)를 계산&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Stage 2:&lt;/strong&gt; CatBoost 출력값 + 잔차를 LightGBM의 입력으로 활용&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;CatBoost의 범주형 처리·일반화 능력에 더해, LightGBM이 예측 오류 영역을 보완하도록 했습니다. 마지막으로 Stacking 예측을 CatBoost 단독 예측으로 보정하는 Ensemble 비율을 실험적으로 탐색해 &lt;strong&gt;최적 비율(n=3)&lt;/strong&gt; 을 도출했습니다.&lt;/p&gt;
$$\hat{y}_{final} = \frac{n \cdot \hat{y}_{stacking} + \hat{y}_{catboost}}{n + 1}, \quad n = 3$$&lt;p&gt;→ 본선 &lt;strong&gt;점수 0.64에서 0.66으로 개선&lt;/strong&gt;, &lt;strong&gt;최종 7위&lt;/strong&gt;를 달성했습니다.&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="핵심-요약"&gt;핵심 요약&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;평가 방식에 맞춘 모델 설계:&lt;/strong&gt; 예선(이진 분류·ROC-AUC)과 본선(확률 회귀·가중 혼합 Score)의 차이를 정확히 반영해 전략을 분리했습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;본선의 핵심 기여:&lt;/strong&gt; 평가식의 가중치를 손실 함수에 직접 반영하고, CatBoost+LightGBM Stacking으로 예측 성능과 안정성을 동시에 확보했습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;해석 가능성:&lt;/strong&gt; 의학적 맥락에 맞춘 비율·상호작용 파생변수로 해석 가능한 예측 구조를 설계했습니다.&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>