Undress AI의 실제 작동 원리: Diffusion, Segmentation, Inpainting에 대한 기술적 심층 분석 (2026)
요약
Undress AI의 기술적 메커니즘을 Segmentation, Pose Estimation, Inpainting의 세 단계로 나누어 심층 분석합니다. SAM 2, SMPL-X, Flux.1-dev-inpaint 등 최신 모델을 활용한 정교한 이미지 생성 과정을 다룹니다.
핵심 포인트
- SAM 2와 CLIP-Seg를 결합한 정밀한 의복 마스킹 기술
- SMPL-X 및 ControlNet을 이용한 해부학적 구조 유지
- 경계선 품질을 높이기 위한 마스크 엔지니어링(Dilation, Blurring)
- Latent Diffusion 모델을 활용한 고품질 인페인팅 구현
지난 2년 동안 생성형 AI (Generative AI) 분야를 지켜봐 왔다면, 피드나 뉴스 기사, 그리고 적대적 콘텐츠 모더레이션 (Adversarial content moderation)에 관한 학술 논문에서
가장 어려운 문제는 어떤 픽셀이 의복인지 식별하는 것입니다. 단순한 해결책으로는 '셔츠', '바지', '원피스'와 같은 프롬프트를 사용하여 CLIP-Seg를 사용하지만, 2026년의 최신 기술(state-of-the-art)은 애니메이션/사진 하이브리드에는 SCHP (Self-Correction Human Parsing)를, 고해상도 포토리얼리스틱 입력에는 SAM 2를 사용합니다.
from segment_anything_2 import SAM2ImagePredictor
import torch
predictor = SAM2ImagePredictor.from_pretrained("facebook/sam2-hiera-large")
predictor.set_image(image)
masks, scores, _ = predictor.predict(
point_coords=clothing_points,
point_labels=[1] * len(clothing_points),
multimask_output=True,
)
clothing_mask = masks[scores.argmax()]
SAM 2는 거의 완벽한 경계를 제공하지만 자신이 무엇을 보고 있는지 알지 못하기 때문에, 대부분의 상용 도구들은 레이블 필터링을 위해 CLIP-Seg를 추가로 결합하여 사용합니다.
3. 스테이지 2 — 포즈 및 형태(Pose & Shape)
의복이 마스킹되면, 모델은 그 아래에 무엇이 있는지 '환각'으로 만들어내야 하며, 이 기반 해부학적 구조는 포즈와 일치해야 합니다. 여기서 많은 구형 도구들이 실패합니다: 손이 몸통에 합쳐지거나, 팔꿈치가 뒤로 굽거나, 배꼽이 누락되는 식입니다. 2026년의 성공적인 조합은 2D 키포인트에는 OpenPose 또는 DWPose를, UV 매핑된 표면 좌표에는 DensePose를, 그리고 파라미터릭 3D 바디 사전 지식(prior)으로는 SMPL-X를 사용합니다. 이 포즈 정보는 인페인팅(inpainting) 단계에서 ControlNet에 공급되어 확산 모델이 원본 이미지와 일관된 해부학적 구조를 생성하도록 제약됩니다.
4. 스테이지 3 — 마스크 엔지니어링(Mask Engineering)
원시적인 분할 마스크는 거의 직접 사용되지 않습니다. 대신, 경계를 블렌딩할 공간을 주기 위해 8~20픽셀만큼 확장(dilated)되고, 가우시안 블러(Gaussian blur)로 부드럽게 처리된 후, 관절이 존중되도록 포즈 맵과 합성됩니다.
import cv2
import numpy as np
```python
def prepare_mask(raw_mask, dilate=12, blur=6):
kernel = cv2.getStructuringElement(cv2.MORPH_ELLIPSE, (dilate, dilate))
dilated = cv2.dilate(raw_mask.astype(np.uint8) * 255, kernel)
feathered = cv2.GaussianBlur(dilated, (0, 0), sigmaX=blur)
return feathered / 255.0
페더링 (feathering) 과정을 생략하면 전형적인 "판지 인형 (cardboard cutout)" 같은 경계선이 나타납니다.
5. 4단계 — 잠재 확산 인페인팅 (Latent Diffusion Inpainting)
2026년 기준, VRAM 대비 품질 순위:
| 모델 | VRAM | 사실감 | 속도 (RTX 4090) |
|---|---|---|---|
| Flux.1-dev-inpaint | 24 GB | ★★★★★ | ~14 s |
| ... |
가장 일관되게 깨끗한 결과물을 생성한 샘플러 (sampler) 설정: DPM++ 2M SDE Karras, 28–34 steps, cfg_scale 5.5–7.0, denoise 0.85–0.95. 재현을 원하는 분들을 위해 출력 예시가 포함된 전체 파라미터 스윕 (parameter sweep) 과정을 확장된 글에 기록해 두었습니다.
6. 내가 실제로 테스트한 7가지 도구
동일한 30장의 테스트 이미지를 가장 많이 언급되는 7가지 상용 파이프라인 (pipeline)에 통과시켰습니다. 아래 순위는 오직 기술적인 출력 품질만을 기준으로 합니다.
1. Undress.app — 전반적인 해부학적 구조와 피부톤 매칭이 가장 뛰어남. 강력한 FaceID 어댑터가 포함된 SDXL 기반 인페인터 (inpainter). 프리미엄 (Freemium) 플랜은 3 크레딧을 제공하며, 베이직 (Basic) 등급은 월 약 $11.99입니다.
2. Undress.cc — 회원가입 없는 모드가 진정으로 빠름 (서버 측 기준 7초). 업로드된 파일은 124시간 이내에 자동 삭제됨. 가장 취약한 부분: 복잡한 포즈를 취한 전신 샷.
3. Clothoff — 역사적으로 언론에서 가장 많이 다뤄진 도구. 하이브리드 모델: 워터마크가 포함된 무료 등급과 월 약 $20의 구독형 서비스. 2025년 말 기준 이탈리아에서 차단됨.
4. PornWorks AI — 언레스 (undress) 모듈이 결합된 일반적인 NSFW 텍스트-이미지 생성기 (text-to-image generator). 흥미로운 자동 콘텐츠 탐지 레이어와 워터마킹 기술을 보유함.
5. DeepStrip — 1회성 5달러 결제, 크레딧 기반 방식. 연령 분류기 (age classifier)가 21세 미만으로 추정하는 모든 피사체를 차단하며, 이는 가장 보수적인 안전 계층 (safety layers) 중 하나임.
6. Nudify Online — 더 단순한 정액제 가격 체계. 출력 품질은 클로즈업(close-ups) 측면에서 Undress.app보다 한 단계 뒤처지지만, 미디엄 샷 (mid-range shots)에서는 경쟁력이 있음.
7. SoulGen — 더 광범위한 AI 컴패니언 (AI-companion) 제품; Undress는 여러 기능 중 하나임. 출력 해상도 (output resolution)가 실제적인 문제임.
VRAM 사용량, 지연 시간 (latency), 그리고 정답지(ground truth) 대비 SSIM 점수를 포함한 상세한 사이드 바이 사이드(side-by-side) 벤치마크 데이터는 여기에서 확인할 수 있습니다 — 여기에는 30개 이미지 전체 테스트 세트 결과와 도구별 실패 모드 (failure-mode) 분석이 포함되어 있습니다.
7. 참조 ComfyUI 워크플로우 (Workflow)
파이프라인 (pipeline)을 로컬에서 재현하고자 하는 분들을 위해: LoadImage → SAMLoader (sam2_hiera_large.pt) → GroundingDinoSAM (프롬프트: "clothing") → MaskDilate (size=14) → MaskBlur (sigma=6) → DWPoseEstimator → ControlNetApply (control_v11p_sd15_openpose) → VAEEncodeForInpaint → KSampler (dpmpp_2m_sde_karras, 30 steps, cfg 6.5, denoise 0.9) (체크포인트 realisticVisionV60B1, LoRA detail_tweaker_xl + skin_texture_v3, 그리고 IPAdapter ip-adapter-faceid-plusv2_sdxl 사용) → VAEDecode → FaceDetailer → Upscale (4x-UltraSharp) → SaveImage.
예상 VRAM: SDXL의 경우 약 11 GB, SD 1.5 변형 모델의 경우 약 6 GB. RTX 4090에서의 실행 시간 (runtime)은 이미지당 8~15초임.
8. 실제 연구가 이루어지는 지점
2026년의 공개된 기술적 문제들: 손과 발의 재구성 (complex poses에서 Flux조차 약 15% 실패함), 이음새 (seam) 전반의 피부톤 일관성, 단일 참조 프레임으로부터의 정체성 보존 (identity preservation), 타이트한 의류에서의 직물 대 피부 모호성 (fabric-vs-skin ambiguity), 그리고 비디오 시간적 일관성 (video temporal consistency). 추천 논문: SAM 2 (Meta, 2024), IP-Adapter FaceID Plus V2 (Tencent, 2024), Stable Diffusion 3.5 기술 보고서 (Stability AI, 2024).
9. 윤리 및 법적 문제
비동의 성적 이미지 (Non-consensual intimate imagery)는 점점 늘어나는 관할 구역 내에서 불법으로 규정되고 있습니다. 영국의 온라인 안전법 (Online Safety Act, 2023), EU AI 법 (EU AI Act), 일본의 개정된 딥페이크 방지법 (2024), 미국의 여러 주 법률, 그리고 연방 차원의 Take It Down Act가 그 예입니다. 이러한 파이프라인 (pipeline)의 유일하게 방어 가능한 사용 사례는 탐지 및 워터마킹 (watermarking) 연구, 명확한 모델 공개 문서가 포함된 동의를 얻은 성인 대상의 창작물, 그리고 제품화 전 안전 계층 (safety layers)에 대한 레드팀 (red-teaming) 테스트뿐입니다.
10. 요약 (Wrap-Up)
기술적 카테고리로서의 Undress AI는 사실상 "강력한 포즈 사전 정보 (pose priors)와 정체성 조건화 (identity conditioning)를 결합한 공격적인 인페인팅 (inpainting)"에 불과합니다. 파이프라인 내의 그 어떤 것도 이례적인 것은 없습니다. 가상 피팅 (virtual try-on), 의료 영상 인페인팅 (medical imaging inpainting), 그리고 영화 VFX의 디에이징 (de-aging) 기술에서도 동일한 구성 요소들이 사용됩니다.
더 깊이 있는 내용을 원하신다면, 가격 정보, 안전 계층 분석 및 업데이트된 2026년 순위가 포함된 도구별 전체 리뷰는 확장판 글에서 확인하실 수 있습니다.
질문, 수정 사항 또는 본인만의 벤치마크 (benchmark) 결과를 공유하고 싶으신가요? 아래에 댓글을 남겨주세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기