<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>SAM | Sieun Kim Portfolio</title><link>https://siuunni.github.io/tags/sam/</link><atom:link href="https://siuunni.github.io/tags/sam/index.xml" rel="self" type="application/rss+xml"/><description>SAM</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>ko-kr</language><lastBuildDate>Mon, 08 Dec 2025 00:00:00 +0000</lastBuildDate><image><url>https://siuunni.github.io/media/icon_hu_1c0e9cb08cfb822a.png</url><title>SAM</title><link>https://siuunni.github.io/tags/sam/</link></image><item><title>텍스트 기반 이미지 색채화 품질 개선</title><link>https://siuunni.github.io/projects/image-colorization/</link><pubDate>Mon, 08 Dec 2025 00:00:00 +0000</pubDate><guid>https://siuunni.github.io/projects/image-colorization/</guid><description>&lt;div style="display:grid;grid-template-columns:130px 1fr;gap:1rem 1.5rem;margin-bottom:2rem;"&gt;
&lt;div style="font-weight:700;"&gt;개요&lt;/div&gt;
&lt;div&gt;텍스트 설명을 따라 흑백 이미지를 색채화하는 생성형 AI 프로젝트입니다. 여러 공개 색채화 모델을 비교하고, 텍스트 의미를 반영하는 추론 파이프라인을 구축했습니다.&lt;/div&gt;
&lt;div style="font-weight:700;"&gt;대회&lt;/div&gt;
&lt;div&gt;2025 INHA AI Challenge, 대학원생 부문 3위&lt;/div&gt;
&lt;div style="font-weight:700;"&gt;기간&lt;/div&gt;
&lt;div&gt;2025.06 ~ 2025.07(약 1달ㄴ)&lt;/div&gt;
&lt;div style="font-weight:700;"&gt;과제&lt;/div&gt;
&lt;div&gt;텍스트(캡션) 조건부 흑백→컬러 이미지 생성, 텍스트 의미 일치도 기반 Score 평가&lt;/div&gt;
&lt;div style="font-weight:700;"&gt;기술 스택&lt;/div&gt;
&lt;div&gt;Python, PyTorch, Diffusers, SAM(Segment Anything), OpenCLIP, NumPy&lt;/div&gt;
&lt;div style="font-weight:700;"&gt;성과&lt;/div&gt;
&lt;div&gt;최종 &lt;strong&gt;Score 0.70&lt;/strong&gt; 달성 (베이스라인 대비 약 17~32% 향상)&lt;/div&gt;
&lt;/div&gt;
&lt;hr&gt;
&lt;h2 id="문제-정의"&gt;문제 정의&lt;/h2&gt;
&lt;p&gt;텍스트 설명을 입력으로 받아 흑백 이미지를 색채화하되, 결과 색상이 텍스트 의미와 일치해야 하는 과제입니다. &amp;ldquo;빨간 셔츠를 입은 사람&amp;quot;이라는 설명이 있으면 실제로 그 셔츠가 빨갛게 칠해져야 점수를 받습니다.&lt;/p&gt;
&lt;p&gt;핵심은 어떤 모델을 쓰느냐보다, 어떤 모델과 추론 전략의 조합이 텍스트 의미를 더 잘 반영하느냐를 실험으로 찾는 것이었습니다.&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="1-공개-모델-비교"&gt;1. 공개 모델 비교&lt;/h2&gt;
&lt;p&gt;먼저 색채화 분야의 주요 사전학습 모델들을 같은 데이터와 환경에서 비교했습니다.&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th style="text-align: left"&gt;모델&lt;/th&gt;
&lt;th style="text-align: center"&gt;Score&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;Unicolor&lt;/td&gt;
&lt;td style="text-align: center"&gt;0.56&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;ControlNet&lt;/td&gt;
&lt;td style="text-align: center"&gt;0.53&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;ControlColor&lt;/td&gt;
&lt;td style="text-align: center"&gt;0.57&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;COCO-LC&lt;/td&gt;
&lt;td style="text-align: center"&gt;0.60&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;&lt;strong&gt;L-CAD (튜닝 후 최종)&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: center"&gt;&lt;strong&gt;0.70&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;같은 조건에서 L-CAD가 가장 좋았고, 이를 메인 모델로 삼아 최적화에 집중했습니다.&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="2-추론-파라미터-튜닝"&gt;2. 추론 파라미터 튜닝&lt;/h2&gt;
&lt;p&gt;초기 실험에서 두 가지 문제가 있었습니다. 같은 입력인데도 랜덤 시드에 따라 색이 달라졌고, 텍스트 의미와 맞지 않는 색이 나오기도 했습니다.&lt;/p&gt;
&lt;p&gt;디퓨전 모델의 결과는 모델 구조만큼이나 추론 설정에 좌우됩니다. 그래서 주요 추론 파라미터를 조정하며 결과의 안정성과 의미 일관성을 확인했습니다.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;DDIM Steps&lt;/strong&gt; — 샘플링 단계 수에 따른 품질, 안정성 변화&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Guidance Scale&lt;/strong&gt; — 텍스트 조건을 얼마나 강하게 반영할지&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Strength&lt;/strong&gt; — 원본 구조를 얼마나 보존할지&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Self-Attention Guidance(SAG)&lt;/strong&gt; — 생성 결과의 일관성 보정&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;여러 차례 실험을 거쳐, 성능을 떨어뜨리지 않으면서 결과 변동성을 줄이는 설정을 찾았습니다.&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="3-객체-단위-앙상블"&gt;3. 객체 단위 앙상블&lt;/h2&gt;
&lt;p&gt;단일 모델의 한계를 확인하기 위해, 객체별로 더 나은 모델 결과를 골라 합치는 앙상블을 설계했습니다.&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;SAM(Segment Anything)&lt;/strong&gt; 으로 이미지 안의 객체를 분리&lt;/li&gt;
&lt;li&gt;각 객체에 대해 COCO-LC와 L-CAD 결과를 모두 생성&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;OpenCLIP&lt;/strong&gt; 이미지–텍스트 유사도로 객체마다 텍스트 의미에 더 맞는 결과를 선택해 합성&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;이 방식은 COCO-LC 단일 모델(0.60) 대비 0.686까지 점수를 올렸지만, 최적화한 L-CAD 단일 모델(0.70)에는 못 미쳤습니다. 객체 경계를 합성하는 과정에서 생기는 부자연스러움이 앙상블의 이점을 상쇄한 것으로 보입니다.&lt;/p&gt;
&lt;p&gt;결국 앙상블보다 L-CAD 단일 모델의 추론 최적화가 더 효과적이어서, 이를 최종 제출안으로 택했습니다.&lt;/p&gt;
&lt;figure style="margin:1.5rem 0;"&gt;
&lt;div style="display:grid;grid-template-columns:repeat(3,1fr);gap:.75rem;align-items:start;"&gt;
&lt;img src="https://siuunni.github.io/uploads/papers/colorization_input.png" alt="흑백 입력 이미지"
style="display:block;width:100%;height:auto;border-radius:8px;border:1px solid rgba(148,163,184,.25);background:#fff;padding:.5rem;box-sizing:border-box;"&gt;
&lt;img src="https://siuunni.github.io/uploads/papers/colorization_lcad_2.png" alt="L-CAD 색채화 결과 1"
style="display:block;width:100%;height:auto;border-radius:8px;border:1px solid rgba(148,163,184,.25);background:#fff;padding:.5rem;box-sizing:border-box;"&gt;
&lt;img src="https://siuunni.github.io/uploads/papers/colorization_lcad_1.png" alt="L-CAD 색채화 결과 2"
style="display:block;width:100%;height:auto;border-radius:8px;border:1px solid rgba(148,163,184,.25);background:#fff;padding:.5rem;box-sizing:border-box;"&gt;
&lt;/div&gt;
&lt;figcaption style="font-size:.8rem;color:#94a3b8;margin-top:.5rem;text-align:center;"&gt;
최종 L-CAD 색채화 결과. 좌측 흑백 입력을 텍스트 의미에 맞게 자연스럽게 색채화한 모습입니다.
&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;hr&gt;
&lt;h2 id="결과"&gt;결과&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th style="text-align: left"&gt;단계&lt;/th&gt;
&lt;th style="text-align: center"&gt;Score&lt;/th&gt;
&lt;th style="text-align: left"&gt;비고&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;최고 베이스라인 (COCO-LC)&lt;/td&gt;
&lt;td style="text-align: center"&gt;0.60&lt;/td&gt;
&lt;td style="text-align: left"&gt;공개 모델 비교 1위&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;SAM + OpenCLIP 객체 앙상블&lt;/td&gt;
&lt;td style="text-align: center"&gt;0.686&lt;/td&gt;
&lt;td style="text-align: left"&gt;단일 모델보다 낮음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;&lt;strong&gt;L-CAD 단일 최적화 (최종)&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: center"&gt;&lt;strong&gt;0.70&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: left"&gt;최종 채택&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;ul&gt;
&lt;li&gt;최저 베이스라인(ControlNet 0.53) 대비 약 32%, COCO-LC(0.60) 대비 약 17% 향상&lt;/li&gt;
&lt;li&gt;2025 INHA AI Challenge 대학원생 부문 3위&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="핵심-요약"&gt;핵심 요약&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;모델 비교로 메인 선정:&lt;/strong&gt; Unicolor, ControlNet, ControlColor, COCO-LC, L-CAD를 같은 조건에서 비교해 L-CAD를 메인 모델로 정했습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;추론 최적화:&lt;/strong&gt; DDIM, Guidance, SAG 등 추론 파라미터를 조정해 의미 일관성을 유지하면서 변동성을 줄였습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;앙상블 검증:&lt;/strong&gt; SAM과 OpenCLIP으로 객체 단위 앙상블을 설계해 비교한 결과, 이 과제에서는 단일 모델 최적화가 더 나았고 최종 Score 0.70을 달성했습니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>