생성 모델을 위한 워터마크 포렌식: 정보 이론적 관점
요약
생성 모델 워터마크의 포렌식 기능을 정보 이론적 관점에서 분석한 연구입니다. 워터마크를 통한 사용자 귀속, 페이로드 추출, 국지화의 비용을 샘플 길이와 엔트로피율의 관계로 정의하고 엄밀한 이론적 법칙을 제시합니다.
핵심 포인트
- 워터마크의 포렌식 기능을 귀속, 추출, 국지화의 단계로 체계화
- 다중 사용자 귀속을 위한 최초의 엄밀한 엔트로피율 법칙(entropy-rate law) 도출
- 페이로드 추출 비용이 엔트로피율에 반비례함을 증명
- GPT-2, Pythia, Qwen2.5 실험을 통해 이론적 예측값 검증
생성 모델의 출력물에 포함된 워터마크는 보통 텍스트가 기계에 의해 만들어졌는지 여부만을 묻는 데 사용됩니다. 하지만 동일한 표식(mark)이 더 많은 일을 할 수 있습니다: 이를 생성한 사용자에게 귀속시키거나, 숨겨진 페이로드(payload)를 추출하거나, 편집 후에도 남아 있는 부분을 국지화(localize)하는 것입니다. 이러한 기능들은 포렌식 사다리(forensic ladder)를 형성하며, 우리는 각 단계가 샘플 길이 $n$ 측면에서 얼마만큼의 비용을 치르는지 질문합니다. 하나의 객체가 이 답변들을 정리합니다. $S$를 표식이 담고 있는 비밀(사용자의 신원 또는 페이로드)이라고 하고, 정보 프로필(information profile) $\nu(t)=I(S;X_t\mid X_{<t})$를 이전 토큰들이 주어졌을 때 $t$번째 토큰이 $S$에 대해 얼마나 많은 정보를 드러내는지 기록한다고 합시다. 이 총 질량(total mass)은 귀속(attribution)과 추출(extraction)의 비용을 지불하며, 이 질량이 어떻게 분산되는지는 국지화(localization)의 비용을 지불합니다. 그리고 탐지(detection) 자체는 정보가 아니라, 표식이 있는 분포와 없는 분포 사이의 거리인 존재성(presence)에 의해 비용이 지불됩니다. 문헌에 등장하는 두 가지 품질 모델, 즉 모든 토큰에서 미묘한 표식과 몇 개의 토큰에 강하게 찍히는 표식은 이 프로필을 제한하는 서로 비교할 수 없는 두 가지 방식입니다. 우리의 주요 정리(main theorem)는 이 사다리의 엔트로피 열(entropy column)을 해결합니다. 통계적으로 왜곡이 없는(distortion-free) 체계의 경우, 텍스트를 $N$명의 사용자 중 한 명에게 귀속시키는 비용은 엔트로피율(entropy rate) $h$를 가진 모든 정체적-에르고딕(stationary-ergodic) 소스에 대해 $(1+o(1))$ 계수까지 정밀하게 $\Theta(\log N/h)$ 토큰이 소요됩니다. 우리가 알기로는 이는 다중 사용자 귀속(정확한 정렬을 통한)에 대한 최초의 엄밀한 엔트로피율 법칙(tight entropy-rate law)입니다. 자연스러운 충돌 계산(collision-counting) 분석은 무제한으로 과다 비용을 청구하지만, 각 후보를 자체적인 실현된 놀람도(realized surprisal)로 임계 처리하는 디코더만이 무고한 사용자를 거의 결백하게 유지하면서 해당 비율을 달성합니다. 일치하는 역관계(converse)는 이 법칙을 양방향으로 만들며, $\ell$-비트 페이로드의 추출 비용은 $\Theta(\ell/h)$입니다. 두 가지 간극은 모델링의 인위적인 결과가 아닌 실제적인 것입니다: 텍스트가 증명 가능하게 기계에 의해 만들어졌으나 귀속은 불가능한 $\Theta(\log N)$ 토큰 윈도우, 그리고 발자국-해상도 불확정성 원리(footprint-resolution uncertainty principle)입니다. GPT-2, Pythia-410M, Qwen2.5에 대한 실험을 통해 예측된 상수들을 회복했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기