Stable Diffusion에서 개념을 지우기(Concept Erasure): ETC (논문)
요약
CVPR 2026에 채택된 논문 'ETC'는 텍스트-이미지 확산 모델에서 개념 제거의 한계를 극복하는 새로운 방법을 제시합니다. 기존 방식들이 가진 확장성, 정밀도, 비용 등의 문제를 해결하기 위해, ETC는 개념 분포를 모델링하고 MoE 기반의 MoEraser 학습을 통해 대규모 개념 제거를 실용적으로 구현합니다.
핵심 포인트
- 개념 제거의 한계: 기존 기법들은 확장성 및 정밀도 문제에 직면함.
- ETC 제안 방식: 개념 분포 모델링과 MoE 기반 MoEraser 학습을 사용.
- 앵커 개념 불필요: 텍스트 임베딩 분포를 활용하여 수작업 앵커 개념이 필요 없음.
- 목표/비목표 분리: 개념 분포 모델링으로 목표 및 비목표 개념 식별 가능.
수천 개의 개념 지우기: 텍스트-이미지 확산 모델을 위한 확장 가능하고 실용적인 개념 제거를 향하여
CVPR 2026 채택 논문입니다.
서적 정보
별도의 언급이 없는 한 다음 논문을 인용합니다.
Hoigi Seo, Byung Hyun Lee, Jaehyun Cho, Sungjin Lim, and Se Young Chun. Erasing thousands of concepts: Towards scalable and practical concept erasure for text-to-image diffusion models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 10262–10272, June 2026.
관련 링크
공식 구현은 저자의 사이트에서 확인할 수 있습니다(논문에는 언급되어 있지 않음).
개념 제거에서의 문제점
기존의 개념 제거 기법은 다음 세 가지로 크게 나뉩니다.
- 기반 모델을 업데이트하는 방식
- 선형 모듈을 추가하는 방식
- 비선형 모듈을 추가하는 방식
시간 순서로 보면, 먼저 기반 모델을 업데이트하는 방식이 제안되었습니다. 한편, 이 방식은 목표(target)가 아닌 개념(non target concept)에 큰 영향을 미칩니다. 이에 따라 선형 모듈을 추가하는 방식이 제안되었습니다. 이 방식은 앞선 문제점을 극복하고 있지만, 확장성(scalability)에 문제가 있었습니다. 비선형 모듈의 추가는 이러한 확장성을 극복해 나가고 있습니다. 하지만 이 방식에서도 아직 해결되지 않은 부분이 있습니다. 저자들은 이를 다음과 같이 주장합니다.
- 가중치 병합이 불가능함
- 외부 모듈을 제거하면 복구되어 버림
- 제거할 개념 수에 따라 추론 비용이 증가함
- 목표가 아닌 개념 유지(non target concept maintenance)를 위해 휴리스틱한 앵커 개념(anchor concept) 선택에 의존함
- 대규모 제거에서는 정밀도가 떨어짐(pinpointness가 사라짐)
- 다양한 도메인에 걸친 이질적인 개념으로 평가가 이루어지지 않음
이러한 과제들을 극복하기 위한 방법으로 Erasing Thousands of Concepts (ETC)를 제안합니다. ETC는
- 개념 분포의 모델링
- MoE 기반의 MoEraser 학습
의 2단계 구성으로 이루어져 있습니다. 이를 순서대로 살펴보겠습니다.
개념 분포의 모델링
모델링
여기서는 문자 그대로 각 개념을 텍스트 임베딩(text embedding) 상의 분포로 모델링합니다. 이를 통해 개념 간의 명시적인 투영이 가능해질 뿐만 아니라, 목표 개념과 비목표 개념의 임베딩을 식별할 수 있습니다. 이 모델링을 통해 얻는 또 다른 장점은 많은 기존 연구에서 사용되어 온 앵커 개념(anchor concept)이 필요 없어진다는 점입니다.
이러한 모델링의 근거는 텍스트 임베딩이 해당 단어가 나타나는 문장의 의미에 따라 변화한다는 당연한 사실에 기반을 두고 있는 것으로 보입니다. 이러한 문장에 따른 임베딩의 변화는 관련 연구에서 분포 모델로 해석되어 왔으며, 그 관점에서도 자연스러운 발상이라고 할 수 있습니다.
구체적으로 개념
일반적으로 Stable Diffusion 등에서 사용되는 텍스트 인코더는 clip-vit-large-patch14입니다.
다음으로,
이러한 분포적인 시각을 통해 문맥에 따른 가변성을 포착하는 동시에, 개념 간의 사상(mapping)을 구축하고 확률 경계로부터 목표 개념 및 앵커 개념을 선택하기 위한 원리적인 메커니즘을 얻게 됩니다. 이를 통해 수작업으로 만든 앵커 개념들의 집합이 불필요해집니다. 그림으로 나타내면 다음과 같습니다.

물론 GMM(Gaussian Mixture Model)을 사용하지 않는지에 대한 질문도 있을 것입니다. 저자들은 논문에서 개념의 임베딩 분포가 경험적으로 꼬리가 무거운(heavy-tailed) 거동을 보인다고 언급합니다. 아래 그림이 이해하기 쉽습니다.

GMM에서는 저확률 샘플에서도 개념(여기서는 Emma Watson)의 강한 존재가 유지되지만, tMM에서는 개념의 존재가 확률에 비례하여 약해지는 것을 알 수 있습니다. 따라서 여기서는 적합합니다.
효율적인 매핑
앵커 개념이 사라졌다고 해도, 사람이 지정할 필요가 없어졌을 뿐 실제로 사라진 것은 아닙니다. 즉, 타겟 개념을 앵커 개념에 투영해야 합니다. 이미지는 아래 그림과 같습니다.

여기서는 최적 수송(Optimal Transport)으로 생각합니다. 구체적으로 개념 $\text{C}$로 정식화합니다. 여기서,
- 선형이므로 네트워크 학습이 용이함
- 여러 개념을 통합한 분포로 투영할 경우, 투영된 분포는 통합된 개념들 사이에 위치하므로 결과적으로 제3의 개념에 일관성을 갖는 경향이 있습니다.
논문 내에서는 두 번째 속성이 안전성을 높이는 예시로 제시되었습니다.

최적 수송은 다음 최적화 문제로 구할 수 있습니다.
여기서,
구현상으로는 매핑 개념 $\text{M}$을 사용합니다.
MoEraser 학습
학습에서는 다음 3가지 종류의 임베딩을 추출합니다.
- 타겟 개념이 되는 임베딩
- 치환에 사용하는 매핑 임베딩
- 비(非)타겟 개념 유지를 위한 앵커 임베딩
선행 연구에서는 앵커를 잘 선택하면 성능 향상에 기여하는 것으로 알려져 있습니다. 한편, 저 역시 이전부터 지적해 왔듯이 이는 수작업으로 선택하는 경우가 많아 확장성이 떨어지고, 제거하고 싶은 개념이 다수 존재할 경우 부적절합니다. 그래서 방금 언급한 분포의 저확률 영역에서 앵커 임베딩을 샘플링합니다.
이 단계에서는 각각의
their efficiency and adaptability across domains could be limited
라고 기술하고 있습니다. 이 MoE를 채택한 것을 MoEraser라고 명명했으며, 아래 그림과 같습니다.

각 전문가(Expert)는 GLU를 사용합니다. 목표는 타겟 개념의 임베딩 $\text{E}_{\text{target}}$이 되는 것입니다.
MoEraser의 여기까지의 부분은 기존 연구에서도 볼 수 있었던 내용입니다. 하지만, 이러한 외부 모듈을 부착할 경우, closed-model에서는 문제가 없지만, HuggingFace에 업로드된 오픈 웨이트 모델의 경우 이를 제거하는 것만으로 원래 상태로 돌아갈 수 있습니다. 여기서 저자들은 모델의 가중치를 노이즈로 교란시켜 원래 임베딩을 재구성하도록 지우기 모듈을 미세 조정하는 Noise Injection–Restore (NIR) 방식을 도입했습니다. 이를 통해, 모듈을 제거했을 때 생성 결과가 열화되기 때문에 MoEraser를 부착하는 것을 강제할 수 있다고 주장합니다. 실제로 생성 결과를 살펴보면, 확실히 무의미한 이미지가 생성되고 있음을 알 수 있습니다.

구체적으로는 모델에 존재하는 모든 투영 선형층(Projection Linear Layer)에 구조화된 노이즈를 주입하여 손상된 가중치 $\text{W}'$를 만듭니다. 여기서,

손실 함수는 $\mathcal{L}$입니다.
실험
평소처럼 설정을 확인한 후 결과를 봅니다.
실험 설정
다음 3가지 설정으로 평가를 진행합니다.
- 이질적인 영역을 가로지르는 대규모 개념 제거
- 고급 확산 모델에 대한 확장
- 50명의 유명인을 대상으로 한 소규모 개념 제거
1과 3에서는 Stable Diffusion v1.4를, 2에는 Stable Diffusion v3.5-Large를 사용합니다. 비교 방법으로는 FMN, ESD, UCE, MACE, CPE, SAFREE, SPEED가 있지만, FMN과 ESD는 소규모 설정에서만 비교됩니다. 또한, SD v3.5-L에서는 UCE, MACE, CPE를 사용할 수 없는 것 같아, SAFREE와 SPEED와의 비교입니다.
나머지 설정이나 평가 방법은 각 서브 섹션에서 확인합니다.
대규모 개념 제거
celebrities, styles, characters라는 3가지 이질적인 영역을 가로지르는 개념을 동시에 제거하는 대규모 실험입니다. 구체적으로 각각에 대해 다음과 같습니다.
⚠️ [IMG:N] 형식 토큰은 이미지 placeholder 입니다. 번역하지 말고 원래 위치에 그대로 유지하세요.
| 개념 카테고리 | 개념 풀 | 제거할 개념 | 제거 후 남는 개념 |
|---|---|---|
| celebrities | 2306 | 949 | 1357 | 325 |
| ... |
공정한 평가를 위해, mapping concept은 유지 개념과 상호 중복되지 않도록 선택합니다.
평가에 대해 말씀드리자면, celebrities의 경우 얼굴 인식 모델을 사용할 수 있지만, 다른 카테고리에는 신뢰할 만한 것이 없습니다. 기존 연구에서는 CLIP Score나 LPIPS가 사용되었지만, 과잉 제거(over-erasure)나 이미지 전체의 열화를 제거 성능 향상으로 잘못 판단할 가능성이 있어 신뢰할 수 있는 지표는 아닙니다. 그래서 이번에는 사용자 조사를 통해 진행합니다. 구체적으로 각 이미지에 대해 참가자는 다음 두 가지를 판단합니다.
- target concept이 유지되었는지
- 이미지 품질이 유지되었는지
이 두 질문에 대한 'Yes' 비율을 기반으로, 다음 지표를 정의하고 조화 평균(harmonic mean)을 사용합니다.
- 첫 번째 기준의 비율: Concept Retention Score (CRS)
- 두 번째 기준의 비율: Quality Score (QS)
여기서,

결과를 보겠습니다.

상단은 SD v1.4로 2072개의 개념을 제거했을 때의 정량적 결과입니다. target concept의 제거에 대해서는, 제안된 방법이 이미지 품질을 유지하면서 celebrities/styles에서 SoTA(State-of-the-Art)를 달성했습니다. characters는 동등한 수준의 제거 성능을 보였지만, 다른 방법들은 생성 이미지의 품질이 저하되었습니다.
non target concept에 대해서는, ETC가 CRS 및 QS 모두에서 SAFREE와 동등하거나 그 이상의 성능을 보여줍니다. SAFREE는 제거하는 데 어려움을 겪고 있음을 알 수 있습니다. 또한,
아래에 제시된 정성적 결과에서도 같은 점을 확인할 수 있습니다.

고급 확산 모델로의 확장
SD v3.5-L를 사용하여 평가를 진행합니다. 앞서와 동일한 개념 풀을 사용하고 다음 설정으로 진행합니다. 평가 역시 앞서와 같이 진행했습니다. 6546개의 이미지 풀을 사용하여 153명의 사용자로부터 6120건의 답변을 수집했습니다.
| 개념 카테고리 | 제거할 개념 | 유지 성능 평가에 사용되는 개념 |
|---|---|---|
| celebrities | 250 | 133 |
| ... | ||
| 결과를 보겠습니다. |

SAFREE는 target concept에 대한 CRS가 일관되게 높아, 제거 성능이 낮은 것을 알 수 있습니다. SPEED는 제거 자체는 성공한 것처럼 보이지만, 이미지 품질이 크게 저하되었음을 알 수 있습니다. 한편 제안된 방법은 제거와 유지 양면에서 우수한 성능을 보여줍니다. 정성적 결과에서도 같은 점을 확인할 수 있습니다. 제안된 방법은 그 아이덴티티만을 지우고, 구도나 색상을 유지했습니다.

소규모 제거
MACE에서 사용된 리스트를 사용하여 50개의 celebrities를 제거합니다. CPE에 따라 잔존 개념(remaining concept)으로 추가 100개의 celebrities와 100개의 styles를 정의합니다. 또한, 일반적인 이미지 생성 능력 평가를 위해 COCO-30K도 포함합니다. celebrities의 경우 GCD의 Top-1 탐지 정확도를 측정합니다. 잔존 개념에 대해서는 CLIP Score를 사용합니다. 품질 평가는 COCO-30K에 대한 FID 및 KID로 측정합니다.
결과를 보겠습니다. 대규모 제거와 유사한 결과임을 알 수 있습니다.

생각할 점
- 평소 제가 생각하는 바를 검증하고 새로운 제안을 하여 성능까지 보여주니 상당히 대단하다고 느꼈습니다. 오랜만에 '맞아, 맞아'라고 느끼면서 읽은 것 같습니다.
- 이번에는 포함되어 있지 않지만, 전문가 분석이나 공격에 대한 견고성(robustness), 계산 비용에 대해서도 ablation 및 supplemental 자료로 언급되어 있어 폭넓은 실험이 진행되었고 매우 인상적이었습니다. 페이지 수가 전부는 아니지만 arXiv에 올라온 논문은 62페이지에 달하며, 사람의 평가를 위한 UI 등도 제시되어 있어 상당한 공을 들인 논문이라고 생각했습니다.
- 아마 이번에는 동시 삭제(simultaneous erasure)일 것 같지만, 지속적으로 개념이 추가되는 설정에서는 어떨지 궁금합니다. 실제로 이미지 생성 모델을 배포할 때마다 삭제 집합(erasure set)을 업데이트하여 베이스 모델에서 삭제하는 것은 현실적인 시나리오는 아닙니다.
참고문헌
- Hoigi Seo, Byung Hyun Lee, Jaehyun Cho, Sungjin Lim, and Se Young Chun. Erasing thousands of concepts: Towards scalable and practical concept erasure for text-to-image diffusion models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 10262–10272, June 2026.
논의(Discussion)

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn ML의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기