무게는 이제 끝났다 - 소비자 GPU에서의 인터랙티브 확산 모델(Diffusion)
요약
본 기사는 소비자 GPU 환경에서 확산 모델(Diffusion models)의 효율적인 구현 방안을 제시합니다. 메모리 사용량과 지연 시간에 민감한 확산 파이프라인의 성능 최적화를 목표로 하며, 임베딩 변환기 개발 및 인터랙티브 온디바이스 이미지 생성 에디터를 제공합니다.
핵심 포인트
- 확산 모델은 메모리 집약적이며 지연 시간에 민감하여 효율적인 구현이 필수적입니다.
- 임베딩 변환기를 통해 가중치와 지연 시간을 줄여 성능을 개선했습니다.
- 최신 GPU에서 서브-세컨드 TTFI를 달성하는 인터랙티브 이미지 생성 에디터를 개발했습니다.
온디바이스 추론은 급증하고 있지만, 그 모멘텀은 거의 전적으로 언어 모델에 집중되어 있습니다. 확산 파이프라인(Diffusion pipelines)은 메모리를 많이 사용하고(memory hungry), 지연 시간에 민감하며(latency-sensitive), 임베더(embedder), 트랜스포머(transformer), 디코더(decoder)를 오케스트레이션해야 하며, 종종 LLM 추론 루프만큼 표준화되지 않은 추가 후처리 과정이 필요합니다. 우리는 성능, 품질, 모델 크기(model footprint) 사이의 상충 관계를 탐색하여 가능한 한 많은 실제 클라이언트 장치에 도달하는 것을 목표로 합니다. 우리는 세 가지 기여를 합니다: 작은 텍스트 인코더를 큰 인코더 공간으로 매핑하여 가중치와 지연 시간을 줄이는 임베딩 변환기(embedding translator); 확산 파이프라인에서 속도/품질/메모리 삼각형을 탐색하기 위한 재현 가능한 스윕 레시피; 그리고 최신 GPU에서 서브-세컨드 TTFI(Time To First Image)를 달성하는 인터랙티브 온디바이스 이미지 생성 에디터입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기