워터마크(透かし)의 작동 원리 및 생성 AI 활용 지속 가능성 검토
요약
본 글은 생성 AI(Gemini, Claude 등)에 도입된 워터마크의 작동 원리와 지속 가능성을 심층적으로 다룹니다. 워터마크는 AI가 단어 선택 확률 계산 과정에 미세한 흔들림을 가하는 방식으로, 오정보 확산 방지 및 출처 공개를 목적으로 합니다. 일반 사용자가 육안으로 감지하기는 어려우며, 탐지 서비스는 제한적입니다.
핵심 포인트
- 워터마크는 AI의 단어 선택 확률에 미세한 흔적을 남기는 메커니즘이다.
- 주요 목적은 오정보 확산 방지를 위한 출처 공개이며 EU AI Act가 배경이 되었다.
- 일반 사용자는 워터마크 유무를 판단하기 어려우며, 탐지 서비스는 제한적으로 운영된다.
- 워터마크 적용 여부와 관계없이, 결과물에 자신의 의견과 고유 정보를 담는 것이 중요하다.
안녕하세요, 닥스훈트입니다.
저는 가끔 블로그를 작성하며 마무리 교정에 LLM을 자주 사용합니다. 그러던 중 'Gemini뿐만 아니라 Claude에도 워터마크(AI로 생성된 것인지 나중에 확인할 수 있는 장치)가 들어간 것 같다'는 것을 알고 몇 가지 궁금한 점이 생겼습니다. 제가 교정에 사용했던 부분에도 이 워터마크가 적용되는지, 만약 적용된다면 워터마크가 삽입된 글을 외부 공개했을 때 불이익을 받는 경우가 있는지, 그리고 공개한 글을 누군가가 확인하고 'AI가 작성한 것'임을 알게 되었을 때 어떤 인상을 주는지 등이 궁금했습니다. 이런 점들이 신경 쓰였습니다.
그래서 이번에는 다음 사항들에 대해 조사해 보았습니다.
-
애초에 워터마크의 목적은 무엇인지
-
Gemini와 Claude에 도입된 워터마크의 메커니즘과 도입 경위는 어떠한지
-
일반인이 AI가 만든 것인지 확인할 수 있는지?
-
워터마크에 강도 같은 것이 있는지?
-
예를 들어, 전부 AI로 작성하게 했을 경우와 교정만 AI를 사용했을 경우와에서 워터마크의 강도에 차이가 생기는지?
-
워터마크가 적용된 후에도 평소처럼 AI를 문서 작성이나 교정, 이미지 생성 등에 계속 사용할 수 있는지?
-
AI를 활용한 결과물을 외부 공개할 때 어떻게 받아들여지는지?
-
직접 개발하는 AI에도 워터마크를 적용할 수 있는지?
평소에 생성 AI를 활용하고 계신 분들이나, 워터마크 도입으로 AI의 사용 편의성이 어떻게 변할지 궁금한 분, 혹은 워터마크 자체의 메커니즘가 궁금하신 분들께 보시면 좋을 것 같습니다.
-
워터마크의 목적은 오정보 확산 등의 악용을 막기 위해 AI가 생성한 콘텐츠임을 공개하는 것입니다. EU AI Act라는 법규가 뒷받침이 되어 Gemini와 Claude에 도입되었습니다.
-
워터마크는 AI가 단어를 선택할 확률에 미세한 흔들림(揺らぎ)을 가하는 메커니즘으로, 생성된 결과물을 본 것만으로는 일반 사용자가 유무를 판단하기 어렵습니다. 탐지 서비스는 일부 조직을 대상으로 한정 공개되어 있으며, 향후 일반 사용자에게도 개방될 가능성이 있습니다.
-
워터마크는 생성 AI의 품질을 떨어뜨리지는 않지만, 강도는 사용하는 방식에 따라 달라집니다. 장문을 처음부터 작성하게 하거나 번역하게 하는 등 생성량이 많은 경우에는 강하고, 교정이나 브레인스토밍처럼 생성량이 적은 경우에는 약합니다.
-
(제 생각) 워터마크가 삽입된 결과물을 공개하는 것 자체는 비판의 요인이 되지 않습니다. 비판받는 것은 내용이 부실한 콘텐츠를 내놓았을 때입니다. 따라서, 워터마크가 적용되어도 평소처럼 생성 AI를 사용해도 좋습니다. 다만 출력을 제대로 검토하고 자신의 의견이나 경험, 구체적인 사례/고유 정보를 담아내는 자세가 이전보다 더 중요해집니다.
-
워터마크란 무엇인지
-
워터마크의 최근 동향 (Claude・Gemini의 2026년 9월 시점 대응 상황)
-
워터마크의 목적과 도입 경위
-
워터마크의 메커니즘 (SynthID)
-
유스케이스별: 교정/번역/코드 등에서 워터마크 강도는 어떻게 달라지는지
-
워터마크가 적용된 결과물을 공개할 때
-
직접 개발한 AI에 워터마크를 도입하고 싶을 경우
-
요약
'워터마크(透かし)'라는 말을 들으면, 지폐나 여권에 사용되는 자외선으로 비칠 때 나타나는 기술이나, 사선 읽기 또는 첫 글자를 연결하면 의미가 통하는 암호문 같은 메커니즘을 떠올리는 사람도 있을 것입니다. 하지만 생성 AI의 워터마크는 이들과 작동 원리가 다릅니다.
AI가 단어를 하나씩 선택할 때의 확률 계산 방식에 '열쇠'를 사용하여 미세하게 손을 가하여 흔적을 남기는 메커니즘입니다. 출력된 문서나 이미지를 본 것만으로는 일반인이 워터마크의 유무를 판단하기는 거의 불가능합니다. 확률에 개입하는 정도도 미미하여 AI의 성능이나 품질에는 거의 영향을 주지 않습니다.
반면, AI로 생성되었는지 확인하려는 쪽에는 생성 시 사용된 '열쇠' 정보가 필요합니다. 이 열쇠를 가진 사람만이 그 문서에 워터마크가 삽입되어 있는지 검증할 수 있습니다. 구체적인 메커니즘은 4장에서 자세히 소개하겠습니다.
Google의 Gemini에는 SynthID라는 워터마크 기술이 내장되어 있습니다. 원래는 2023년에 이미지용으로 발표되었고, 2024년에는 텍스트용(SynthID-Text)이 추가되었습니다. 그리고 2026년에는 Claude에도 텍스트에 대한 워터마크가 도입되었습니다.
현재 대응 상황을 관점을 맞춰 비교하면 다음과 같습니다.
| 대응 형식 | 작동 원리 | 적용 범위 | 탐지 수단 |
|---|---|---|---|
| Gemini | 이미지・음성・텍스트・영상 (Veo) | SynthID (Google DeepMind 개발) | Gemini・Veo로 생성된 콘텐츠 |
| Claude | 텍스트, 파일 (이미지・SVG 등) | 텍스트는 SynthID를 기반으로 한 메커니즘입니다. 파일은 SynthID와 별도의 C2PA 방식을 사용합니다. | Claude 전 제품(Claude Chat・Cowork・Code・Claude Platform 등)에서 생성된 콘텐츠. AWS・Google Cloud・Azure를 통해 Claude 모델을 이용해 생성된 콘텐츠. |
최근 생성 AI의 생성물은 인간이 만든 것과 구별하기 어려울 정도의 품질에 이르렀습니다. 이는 긍정적인 영향뿐 아니라 바람직하지 않은 영향도 가져옵니다. 예를 들어, 오정보 확산이나 피싱 사기 같은 악용 위험이 높아집니다.
이러한 배경을 바탕으로 「AI가 생성한 콘텐츠임을 공개하고, 악용을 방지한다」는 목적으로 워터마크(透かし)가 검토되게 되었습니다. 이에 대응하여 Google이 추진한 것이 SynthID라는 기술입니다.
또한, Google이나 Claude를 비롯한 다양한 AI 벤더들이 일제히 워터마크에 참여하게 된 이유 중 하나는 EU AI Act라는 법규정 때문입니다. 구체적으로 제50조에서는 합성 음성, 이미지, 영상, 텍스트를 생성하는 AI 시스템 제공자에게 그 출력을 기계가 읽을 수 있는 형태로 마킹하고, AI가 생성・변경했음을 탐지할 수 있도록 의무를 부과하고 있습니다. Anthropic 역시 이 규제에 대응하는 코드 오브 프랙티스(Code of Practice)에 서명했으며, Google이나 Meta, Microsoft, OpenAI 등 190개 이상의 사업자가 같은 틀에 참여하고 있습니다. 대상은 2026년 8월 2일 이후에 출시된 모델이며, 그 이전의 모델은 이행 기간 중이라는 위치입니다.
Claude에서는 당초 EU에 제공하는 AI 모델만 워터마크를 도입하는 메커니즘도 검토되었습니다. 다만, 이용자의 리전과 AI 모델의 리전 조합에 따라 워터마크 적용 여부를 전환하는 방식이 번거롭기 때문에, 전 사용자・전 리전에 워터마크를 적용하는 방침으로 결정되었습니다. 이로 인해 일본에서 이용하더라도 워터마크가 도입되어 있습니다.
참고로, 워터마크를 사용해 모델의 증류(다른 회사가 자사 모델의 출력에서 지식을 빼내는 행위)를 탐지한다는 연구 주제도 존재하지만, 이는 이번 Claude・Gemini에 적용된 워터마크의 목적은 아닙니다. 예를 들어, Anthropic은 워터마크가 저작권이나 법적 책임과는 관련이 없음을 명확히 밝히고 있습니다.
덧붙여, 뉴스 사이트 Substack이나 음악 플랫폼 Suno처럼 워터마크와 별도로 자체 AI 탐지 서비스를 도입한 사례도 있습니다. 다만, 이들은 목적과 메커니즘 모두 워터마크와는 다른 것입니다. Substack은 AI로 작성된 글을 사람이 작성한 것처럼 위장하는 행위(Substack은 이를 「Claudefishing」이라고 부릅니다)를 탐지할 목적으로 AI 탐지 서비스 Pangram과 제휴했습니다. Suno는 저작권 등 법적인 문제 대응 차원에서 자사 플랫폼에서 생성된 곡에 워터마크를 도입하고 있습니다. 메커니즘 측면에서도, 열쇠를 사용해 검증하는 SynthID와 달리 문체의 특징 같은 패턴을 보고 판정하는 방식이 사용되고 있습니다.
여기서는 Gemini나 Claude의 워터마크에 이용되는 SynthID의 메커니즘을 텍스트 생성 예시로 소개합니다.
LLM은 문장을 토큰 단위로 선택하며 생성하지만, 다음에 올 단어에 대해 거의 동일하게 자연스러운 후보가 여러 개 있을 수 있습니다. SynthID는 사전에 준비된 비밀 '키(key)'와 직전의 몇 개의 토큰을 조합하여 해시 함수를 거치고, 거기서 계산된 값을 바탕으로 이 선택 과정에 통계적인 '변동성(fluctuation)'을 부여합니다. 이를 통해 나중에 생성된 문장의 경향을 보았을 때, 아마도 이 키에서 비롯된 '변동성'에 의해 생성된 글일 것이라고 검증하는 것이 가능해집니다.
예를 들어, "오늘 날씨는 추워서"라는 문장에서 다음에 올 단어가 "흐림"이든 "음침함"이든 의미적으로 둘 다 적절한 경우가 있습니다. 워터마크(透かし)를 적용하지 않은 일반적인 생성이라면 두 단어 중 하나가 무작위로 선택되겠지만, 키에서 비롯된 변동성을 더함으로써 "흐림" 쪽이 선택되기 쉬워집니다. 글을 본 사람은 "흐림"의 출현 빈도가 높다는 것만으로도, "흐림"이 선택되기 쉬운 변동성을 사용하여 생성되었을 것이라고 추정할 수 있게 되는 것입니다.
다만, 이 '변동성'을 이용한 검증은 확률적인 방법이기 때문에, 워터마크의 강도는 LLM의 생성량에 따라 달라집니다. 생성하는 문장량이 많을수록 변동성을 섞는 부분이 늘어나기 때문에, 워터마크가 강하게 반영되어 "이것은 LLM으로 생성되었을 가능성이 높다"라는 검증 결과를 얻기 쉬워집니다. 반대로 생성량이 적으면 변동성을 섞을 여지 또한 적어지고, 워터마크는 약해져서 "AI가 생성한 것인지 아닌지는 알 수 없다"라는 검증 결과가 나옵니다.
SynthID를 도입하더라도 텍스트의 품질, 정확성, 창의성, 속도는 떨어지지 않는지에 대해서는 Google이 실제 트래픽 일부에서 비교 검증을 진행한 결과, 통계적으로 유의미한 차이가 없으며 영향은 없다고 보고했습니다.
이번에는 텍스트 생성을 예로 들어 소개했지만, SynthID는 원래 2023년에 이미지용으로 발표되었고, 2024년에 텍스트, 그 후 비디오(Veo용)로 확장된 기술입니다. 또한 이 방법은 OSS인 "SynthID Text"로도 공개되어 있어, 직접 HuggingFace에서 AI 모델을 사용할 경우 워터마크를 적용하거나 나중에 감지하는 메커니즘을 구현할 수 있습니다.
Claude의 텍스트 생성용 워터마크 역시 이 SynthID를 기반으로 한 방식입니다. Anthropic 공식 발표에 따르면, 워터마크는 추가 토큰을 필요로 하지 않아 속도나 비용에 영향을 주지 않으며, 또한 워터마크나 키 안에 개인이나 조직을 특정할 수 있는 정보는 일절 포함되어 있지 않다고 합니다.
참고로 Claude가 이미지 파일(.png/.jpg/.svg 등)을 생성하거나 처리하는 경우에는 텍스트의 워터마크와는 별도의 메커니즘이 사용됩니다. C2PA라는 업계 표준의 '콘텐츠 자격 증명(Content Credentials)'으로, 해당 파일이 Claude에 의해 만들어졌다는 것을 암호 서명이 포함된 메타데이터로 기록하는 방식입니다. 텍스트 워터마크가 본문 자체에 내장되는 것과 달리, C2PA는 파일에 부수되는 기록이기 때문에 성격이 다릅니다.
지금까지 소개한 SynthID의 메커니즘을 고려할 때, 워터마크는 생성 AI의 품질이나 창의성, 속도를 떨어뜨리지 않습니다. 한편, 워터마크의 강도(생성 AI로 만들어졌는지 검증했을 때 '이것은 생성 AI가 만든 것이다'라고 얼마나 강하게 말할 수 있는가)는 일정하지 않으며, 생성 AI가 생성하는 양이 많거나 다음에 올 단어 후보가 풍부하여 창작의 여지가 있을 경우 강해집니다. 반면, 생성량이 적거나 다음에 올 단어 후보가 제한되는 경우에는 약해집니다.
이러한 특징을 바탕으로 사용 사례별로 워터마크의 강도를 정리하면 다음과 같습니다.
| 사용 사례 | 강도 | 이유 |
|---|---|---|
| 브레인스토밍으로 아이디어를 나열할 때 | 약함 | 출력이 짧은 단어나 구절의 나열이 되기 쉬워, 워터마크가 적용될 여지가 적기 때문 |
| ... | ||
| 다시 말해, 이번에 제가 진행했던 블로그 작성에서 첨삭만 생성 AI를 사용하는 경우에는, 처음부터 쓰게 하는 경우보다 워터마크가 훨씬 약해진다고 할 수 있습니다. |
덧붙여, 생성된 문장을 나중에 의도적으로 문자열 치환 등으로 수정하면 워터마크의 효력은 사라집니다.
여기서부터는 제 생각입니다만, 워터마크가 포함된 콘텐츠를 공개하는 것 자체는 비난이나 이미지 악화로 이어지지 않는다고 생각합니다. 인상을 좌우하는 것은 어디까지나 콘텐츠 내용 그 자체입니다. 비판받을 일이 있다면, 생성 AI의 출력을 그대로 수용하여 내용이 부실한 것을 공개했을 때일 것입니다. 워터마크가 붙어 있더라도, 생성 AI를 잘 활용하여 완성도 높은 콘텐츠를 공개하는 것 자체에는 문제가 없다고 생각합니다.
이와 관련하여 조사 결과로, TWOSTONE&Sons가 2026년에 실시한 조사 결과가 있습니다. BtoB용 상재의 비교 검토 및 발주 업무를 담당하는 사용자 110명을 대상으로 영업 콘텐츠를 보고 'AI가 만든 것 같다'고 느낀 경험이나, 그때의 인상 및 행동에 대해 들은 것입니다. AI가 만들었다고 느끼는 요인으로 상위에 거론된 것은 '내용이 빈약하고, 검색하면 알 수 있는 정도의 내용', '너무 정돈되어 사람이 주는 온기를 느끼지 못함', '구체적인 사례나 고유명사가 없어 막연함'과 같은 경우였습니다. 그리고 'AI가 만들었다'고 느꼈을 경우, 약 50% 확률로 그 이후에 문의하거나 자료를 다운로드할 마음이 사라졌다고 답변했습니다 (AI스러운 영업 콘텐츠로 절반이 이탈 수용과 거부의 경계 — Forbes JAPAN).
이 결과도 바탕으로 볼 때, 생성 AI를 활용할 때는 출력을 맹신하지 않고, 자신의 말이나 구체적인 사례를 담아 내용이 알찬 콘텐츠로 만드는 것을 염두에 두는 것이 좋다고 생각합니다.
여기까지는 Claude나 Gemini를 이용하는 입장에서 워터마크(透かし)를 소개했지만, 여기서는 자신이 생성 AI 모델을 개발·제공할 경우의 대응 방침도 소개하겠습니다.
SynthID-Text는 Google DeepMind가 OSS (GitHub: google-deepmind/synthid-text)로 공개하고 있지만, 이는 논문 내용을 재현하기 위한 레퍼런스 구현이며, 본 번영용은 아니라고 명시되어 있습니다. 실제로 본 번영에 도입할 경우에는 HuggingFace에서 제공하는 Transformers 라이브러리를 사용하는 것이 권장됩니다.
Transformers에서는 2024년 10월부터 SynthID 메커니즘이 탑재되었으며, 생성 AI 모델에 워터마크를 적용하는 것과 검출기를 사용한 워터마크 검증 둘 다 이용할 수 있습니다. 두 경우 모두 원래의 생성 AI에 손을 가하지 않고 (재학습 등의 필요 없이) 적용할 수 있다는 점도 특징입니다 (SynthID Text in Transformers — Hugging Face Blog).
구체적으로는, 모델 클래스가 생성을 (추론) 실행할 때, SynthIDTextWatermarkingConfig (SynthID 관련 설정 정보 클래스)를 전달하는 것만으로 워터마크를 적용할 수 있습니다. 이 클래스에서는 다음 2가지 파라미터를 지정합니다.
keys: 워터마크 점수 계산에 사용하는 무작위 정수의 리스트 (20~30개 정도가 권장) -
ngram_len: 검출 용이성과 변형에 대한 강도의 트레이드오프를 결정하는 값입니다 (기본값은 5, 최소는 2).
이러한 설정들은 모델별로 개별적으로 보유하고 공개하지 않고 안전하게 관리해야 합니다. 유출될 경우 누구나 같은 워터마크를 모방할 수 있기 때문입니다.
코드 예시는 다음과 같습니다. 기존 코드에 작은 변경만으로 충분하다는 것을 알 수 있습니다.
from transformers import (
AutoModelForCausalLM,
AutoTokenizer,
...
Transformers에는 현재 베이즈 추정(Bayesian estimation)을 기반으로 한 분류기 (워터마크 유무를 2클래스 분류하고 확신도를 반환)가 검출기로 준비되어 있습니다. 다만 이 검출기는 사전 학습이 필요하며, 다음 절차로 데이터를 준비하여 학습시켜야 합니다.
- 데이터 준비: 특정 워터마크 설정을 적용한 생성 AI의 출력과, 워터마크를 적용하지 않은 생성 AI의 출력을 각각 수집합니다 (안내 기준으로 최소 1만 건 정도의 데이터가 필요하다고 되어 있습니다)
- 사전 학습 수행: 워터마크 유무를 2클래스 분류하고 확신도를 반환할 수 있도록 학습시킵니다 (분류기의 정확도를 높이기 위한 시행착오가 필요합니다)
동일한 토크나이저나 워터마크 설정을 사용하는 모델들끼리는 검출기를 재사용할 수 있습니다. 또한, 조직 내에서 공유하는 경우 프라이빗 Hugging Face Hub에 업로드하는 방법이 있습니다.
여기까지, 워터마크에 대해 각 사(Google・Claude)의 노력이나 SynthID 메커니즘, 유스케이스별 워터마크 강도의 차이점을 소개했습니다. 내용을 요약하면 다음과 같습니다.
-
워터마크의 목적은 오정보 확산 등의 악용을 방지하기 위해 AI가 생성한 콘텐츠임을 공개하는 것입니다
-
EU AI Act라는 법규가 제정된 것도 발판이 되어, Gemini・Claude의 워터마크 기능이 도입되었습니다.
-
워터마크(透かし)는 AI가 단어를 선택할 확률에 미세한 변동을 주는 메커니즘으로, 생성된 결과물을 본 것만으로는 일반 사용자가 유무를 판단하기 어렵습니다.
-
Gemini나 Claude의 경우 감지 서비스가 일부 조직을 대상으로 제한적으로 공개되어 있으며, 향후 일반 사용자에게도 개방될 가능성이 있습니다.
-
워터마크는 생성 AI의 품질을 떨어뜨리지 않지만, 강도는 사용 방식에 따라 달라집니다. 장문을 처음부터 작성하게 하거나 번역하는 등 생성량이 많은 경우에는 강하게, 교정이나 브레인스토밍처럼 생성량이 적은 경우에는 약해집니다.
워터마크가 적용됨으로써 기업이나 단체가 공개하는 콘텐츠에 대해서도 생성 AI로 만들어졌는지 여부를 검증할 수 있게 됩니다. 다만 개인적으로는 워터마크가 붙은 콘텐츠를 공개하는 것 자체가 문제가 되기보다는, 내용이 부실한 콘텐츠를 공개하는 것이 비판의 요인이 될 것이라고 생각합니다. 앞서 언급된 TWOSTONE&Sons의 조사 결과에서 제기된 'AI 같다'고 느껴지는 요인도 고려할 때, 생성 AI를 활용할 때는 다음과 같은 점을 유념하는 것이 좋다고 생각합니다.
- 출력을 꼼꼼하게 검토하기
- '조사하면 알 수 있는 내용'으로 끝내지 않고, 자신의 의견이나 검증한 사실, 실제로 손을 움직여 경험한 내용을 포함시키기
- 추상적인 표현에 의존하지 않고, 구체적인 사례나 도구명/수치와 같은 고유 정보를 넣기
끝까지 읽어주셔서 감사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기