Diffusion Model
데이터에 노이즈를 더하고 다시 제거하는 과정을 학습하는 생성 모델.
— 생성형 AI 이미지 모델의 대표 아키텍처
무작위 노이즈에서 아름다운 이미지를 뽑아내는 마법 같지만, 프롬프트 한 줄 바꿨다고 손가락이 여섯 개가 되는 현실도 함께 온다. 노이즈는 제거했는데 왜 손가락은 증식했나요
1. 개요
Diffusion Model(확산 모델)은 데이터에 점진적으로 노이즈를 추가하는 과정과, 그 노이즈를 다시 제거해 원본에 가까운 데이터를 복원하는 과정을 학습하는 딥러닝 기반 생성 모델이다. 이미지 생성 분야에서 Stable Diffusion, DALL-E 계열, Imagen 같은 모델의 기반으로 널리 알려졌다. 핵심 직관은 깨끗한 이미지를 완전한 노이즈로 망가뜨리는 과정을 배운 뒤, 반대로 노이즈에서 이미지를 복원하는 방법을 익히는 것이다. 이 방식은 생성형 AI 붐에서 이미지 생성 품질을 크게 끌어올렸고, 컴퓨터 비전의 생성, 편집, 복원 작업 전반에 영향을 줬다.
2. 노이즈를 넣고 다시 지우기
Diffusion Model은 학습 단계에서 이미지에 아주 조금씩 노이즈를 더해 결국 순수한 노이즈에 가깝게 만든다. 모델은 각 단계에서 “현재 노이즈 섞인 이미지에서 어떤 노이즈를 제거해야 더 깨끗해지는가”를 학습한다. 생성 단계에서는 무작위 노이즈에서 시작해 이 제거 과정을 여러 번 반복하며 이미지를 만든다. 그래서 diffusion 모델은 한 번에 이미지를 뚝딱 생성하기보다 여러 샘플링 스텝을 거치는 경우가 많다. 품질은 좋지만 계산량이 크고, GPU 자원을 꽤 많이 요구한다.
3. 텍스트 조건부 이미지 생성
오늘날 유명한 diffusion 모델들은 단순히 이미지를 생성하는 데서 그치지 않고, 텍스트 프롬프트를 조건으로 삼아 원하는 이미지를 만든다. “우주복을 입은 고양이” 같은 문장을 넣으면 텍스트 임베딩을 조건으로 사용해 그 의미에 맞는 이미지를 복원한다. 여기에 이미지 편집, 인페인팅, 스타일 변환, 초해상도 같은 기능이 붙으면서 생성형 이미지 도구가 폭발적으로 늘어났다. 다만 모델은 언어와 시각의 관계를 확률적으로 배운 것이므로, 정확한 글자 렌더링이나 해부학적으로 자연스러운 손 표현처럼 세부 제어가 어려운 경우도 많다.
4. 관련 밈 및 드립
4.1. 손가락 여섯 개 문제
초기 이미지 생성 모델의 대표적인 약점으로, 사람 얼굴은 그럴듯한데 손가락 개수가 이상하게 나오는 현상을 가리킨다. 모델은 손이 자주 보인다는 것은 배웠지만, 손가락 구조를 정확히 세는 일은 생각보다 까다로웠다.
4.2. 프롬프트 주문술
원하는 이미지를 얻기 위해 프롬프트에 스타일, 렌즈, 조명, 작가풍, 품질 키워드를 끝없이 덧붙이는 문화. 개발자와 디자이너가 어느 순간 마법 주문을 외우는 사람처럼 변한다.
5. 여담
- GAN의 뒤를 이은 주류: 한동안 이미지 생성은 GAN이 상징이었지만, diffusion 모델은 안정적인 학습과 높은 품질로 생성 모델의 중심을 크게 바꿨다.
- U-Net의 재등장: 많은 diffusion 이미지 모델은 노이즈 제거 네트워크로 U-Net 계열 구조를 사용한다. 의료 영상 세그멘테이션에서 유명했던 구조가 생성 모델에서도 중요한 역할을 맡았다.
- 속도 개선 경쟁: 기본 diffusion 샘플링은 여러 단계를 거쳐 느릴 수 있어, 더 적은 스텝으로 좋은 이미지를 만드는 distillation과 sampler 연구가 활발하다.