AI 워터마크 증거의 포렌식 준비성 실패: 실증적 평가
요약
LLM 워터마크 기술이 법적 증거로서 갖는 포렌식적 신뢰성을 실증적으로 평가한 연구입니다. KGW, Unigram, SynthID-Text를 대상으로 패러프레이징 공격을 수행한 결과, 대부분의 워터마크가 쉽게 제거되어 법적 기준을 충족하지 못함을 확인했습니다.
핵심 포인트
- 패러프레이징 공격 시 KGW와 Unigram의 워터마크 제거율 100% 기록
- SynthID-Text 역시 높은 위음성률과 불확실성을 보임
- 테스트된 모든 방법론이 법적 Daubert 허용성 기준을 충족하지 못함
- 새로운 포렌식 준비성 점수(FRS) 프레임워크 제안 및 한계점 분석
정부들은 LLM(대규모 언어 모델)이 생성한 콘텐츠에 워터마크를 포함하도록 점점 더 강제하고 있습니다. EU AI Act는 "충분히 신뢰할 수 있고 강력한" 표시를 요구합니다. 캘리포니아의 SB 942는 "영구적이거나 제거하기가 매우 어려운" 공개를 요구합니다. 두 명령 모두 검증되지 않은 가정, 즉 워터마크 탐지가 법정에서 충분히 신뢰할 수 있는 증거를 생성한다는 가정에 기반하고 있습니다. 본 논문은 이 가정을 직접 테스트합니다. 우리는 KGW, Unigram, 그리고 MarkLLM의 SynthID-Text 구현이라는 세 가지 대표적인 LLM 워터마킹 방법을 Daubert 허용성 기준(Daubert admissibility criteria)과 NIST SP 800-86 디지털 포렌식 프로세스에 따라 평가합니다. 이 평가를 구조화하기 위해, 우리는 12가지 기준, 3가지 필수 게이트, 그리고 60점 만점의 점수 체계를 가진 포렌식 준비성 점수 (Forensic Readiness Score, FRS) 프레임워크를 제안합니다. 우리는 의미를 보존하는 패러프레이징 (meaning-preserving paraphrase)을 공격 벡터로 집중적으로 다루는데, 이는 법적으로 현실적이며 증거 조작으로 치부하기 어렵기 때문입니다. 결과는 심각한 증거적 우려를 불러일으킵니다. 방법론당 15개의 다양한 프롬프트에 걸쳐 수행된 846회의 유효한 패러프레이징 실행 결과, 처음에 탐지된 모든 KGW 및 Unigram 텍스트는 패러프레이징 이후 워터마크를 상실했습니다 — 100% 조건부 제거 (conditional removal)가 발생했습니다. SynthID는 98.3%로 아주 약간 더 나은 성적을 보였습니다. 공격이 시작되기도 전에 이미 위음성률 (false-negative rates)이 높았습니다: KGW는 70%, Unigram은 83%, SynthID는 80%였습니다. 또한 SynthID 설정은 패러프레이징된 인간 작성 대조군(controls)의 5.4%를 AI 생성물로 잘못 표시했으며, 18.6%의 역설률 (paradox rate)을 보였습니다. 즉, SynthID 자체의 깨끗한 워터마크 포함 출력물의 80%가 불확실성 데드밴드 (uncertainty deadband) 영역에 떨어졌습니다. 세 가지 방법 중 어느 것도 Daubert 요인 5가지 중 2가지 이상을 충족하지 못합니다. 우리는 또한 FRS 점수 기반 시스템이 설계된 대로 작동함에도 불구하고, 포렌식적 무용성 (forensic uselessness)을 완전히 포착할 수 없다는 점을 발견했으며, 이는 향후 프레임워크 설계 시 주목해야 할 한계점입니다. 테스트된 바와 같이, 이러한 설정들은 법원이 요구하는 증거적 기준을 충족하지 못합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기