EU 텍스트 출처 증명 규칙에 대한 당사의 접근 방식
요약
EU AI Act 대응으로 텍스트 출처 증명(Content provenance)의 중요성이 커지고 있습니다. OpenAI는 전 세계 API 고객에게 텍스트 워터마킹 옵트인 기능을 제공하며, 'textGrain'이라는 기술로 모델 단어 선택에 눈에 보이지 않는 통계적 신호를 추가합니다. 이 기능은 생성된 콘텐츠의 출처를 증명하는 데 도움을 주지만, 짧거나 제약이 많은 텍스트, 또는 편집 시 워터마크가 약화될 수 있다는 한계를 가집니다.
핵심 포인트
- EU AI Act 대응으로 텍스트 워터마킹 옵트인 기능 제공
- textGrain 기술은 단어 선택에 통계적 신호를 추가하여 출처 증명
- 워터마킹 탐지기는 짧거나 제약이 많은 텍스트에서 성능 저하 발생 가능
- 편집(동의어 대체 등)을 거치면 워터마크가 약화되어 탐지가 어려움
오늘날 기술의 한계 내에서 투명성을 증진하는 것입니다.
[IMG:N]
콘텐츠 출처 증명(Content provenance)은 사람들이 콘텐츠가 어디서 왔는지, 어떻게 생성되거나 편집되었는지, 그리고 우리 모델과 관련된 신호를 포함하고 있는지 이해하는 데 도움을 줍니다. 우리는 이미 우리 모델이 생성한 이미지와 오디오를 식별할 수 있는 도구를 공개적으로 제공했습니다. 오늘, 우리는 EU AI Act에 대응하여 텍스트 워터마킹(text watermarking)에 대한 당사의 접근 방식을 공유하며, 이것이 우리의 광범위한 작업과 어떻게 연결되는지 설명합니다.
EU AI Act는 생성형 AI 제공업체에게 생성된 텍스트를 기계가 읽을 수 있는 방식으로 식별 가능하게 만들 것을 요구합니다. 텍스트 워터마킹 및 탐지는 여전히 상당한 한계를 가진 초기 기술이며, 그 이점과 책임감 있는 사용에 대한 견해는 아직 발전하는 단계입니다. 당사의 단계적 접근 방식은 EU AI Act의 요구 사항뿐만 아니라 기술의 한계도 반영하며, 텍스트 워터마크가 사람들에게 무엇을 알려줄 수 있고 무엇을 알려줄 수 없는지에 대한 투명성에 중점을 두고 있습니다:
오늘부터 전 세계 API 고객들은 특정 모델에 대해 텍스트 워터마킹 옵트인(opt in)이 가능해집니다. 텍스트 워터마킹은 기본적으로 API에서 비활성화된 상태로 유지됩니다.
앞으로 몇 주 동안, 우리는 유럽 연합 내 적격한 ChatGPT 및 Codex 텍스트 출력물에 보이지 않는 워터마크를 추가할 것입니다.
우리는 텍스트 워터마크 탐지기(text watermark detector) 접근을 위한 신청을 받습니다. 이 접근은 초기에는 기술을 평가하고 개선하는 데 도움을 줄 수 있는 승인된 연구원 및 전문 기관으로 제한될 것입니다.
위 내용은 텍스트 출처 증명에만 적용됩니다—우리의 오디오 및 이미지 검증 도구(openai.com/verify 웹 도구를 포함하며, Content Provenance API도 마찬가지입니다)는 여전히 이미지나 오디오 파일이 우리 시스템 중 하나에 의해 생성되었는지 이해하고자 하는 조직들에게 공개적으로 접근 가능할 것입니다.
워터마킹의 작동 방식과 성능
당사의 텍스트 워터마킹 기술인 textGrain은 모델의 단어 선택에 눈에 보이지 않는 통계적 신호를 추가합니다. 당사의 탐지기는 이 신호를 찾아 해당 구절이 OpenAI 워터마크를 포함하는지 평가합니다. textGrain이 어떻게 작동하는지에 대한 더 자세한 내용은 저희 기술 보고서(새 창에서 열림)에서 확인할 수 있으며, 이 보고서는 앞으로 몇 주 동안 추가 세부 정보로 업데이트될 예정입니다. 또한 다른 사람들이 이를 기반으로 구축할 수 있도록 이 기술을 오픈 소스로 공개할 계획도 있습니다.
당사의 평가에 따르면, textGrain은 텍스트용 SynthID를 포함하여 테스트한 다른 접근 방식들의 성능과 같거나 그 이상이었습니다. 그럼에도 불구하고, 이상적인 조건에서의 강력한 성능이 일상적인 사용에서 신뢰할 수 있는 탐지를 보장하지는 않습니다.
탐지기는 두 가지 종류의 오류를 범할 수 있습니다. 워터마크가 존재하지 않는데도 있다고 보고하는 경우(오탐지, false positive)나, 워터마크가 존재하는데 놓치는 경우(미탐지, false negative)입니다. 아래 평가들은 몇 가지 어려움을 보여줍니다:
더 짧거나 제약이 많은 텍스트는 탐지하기 더 어렵습니다. 목표 오탐지율 1%에서, 당사의 탐지기는 심리학과 같은 콘텐츠의 200 토큰 구절에서 약 80%의 워터마크를 식별한 반면, 400 토큰 구절에서는 약 95%였습니다. 단어 선택에 유연성이 적은 수학과 같은 콘텐츠의 경우 탐지율이 현저히 낮았습니다.
편집은 워터마크를 약화시킬 수 있습니다. 400 토큰 구절을 평가했을 때, 단어의 10%를 동의어로 대체하자 탐지율이 약 92%에서 66%로 감소했습니다. 단어의 25%를 대체하자 17%로 감소했습니다.
이러한 한계점들은 당사가 초기 탐지기 접근을 승인된 연구원 및 전문 기관에만 제공하기로 결정하는 데 기여했으며, 이들이 신뢰성과 책임 있는 사용 사례를 평가하는 데 도움을 줄 수 있습니다.
이 차트는 목표 오탐지율 1%에서 ELI5 데이터셋(새 창에서 열림)의 수학 및 심리학 질문에 대한 워터마크가 적용된 응답 결과를 보여줍니다. 탐지는 텍스트 길이가 길어질수록 개선되지만, 단어 선택에 유연성이 적은 수학과 같은 콘텐츠에서는 전반적으로 현저히 낮습니다.
편집(Editing)은 워터마크 신호(watermark signal)를 크게 약화시킬 수 있습니다. 이 차트는 구절의 단어 10% 또는 25%를 대체하는 것이 탐지율에 어떤 영향을 미치는지 보여줍니다. 결과는 ELI5(새 창에서 열림)의 질문에 대해 워터마크가 적용된 영어 응답을 기반으로 합니다.
워터마킹이 출력 품질에 미치는 영향 (Impact of watermarking on output quality)
Astra, 당사의 최신 프론티어 모델(frontier model)을 평가하는 데 사용하는 모든 벤치마크에서 워터마킹 유무에 따른 의미 있는 성능 차이를 발견하지 못했습니다.
벤치마크 (Benchmark)
| 워터마크 미적용 텍스트 (Astra, max) | 워터마크 적용 텍스트 (Astra, max) | |
|---|---|---|
| Artificial Analysis Intelligence Index | 49.57점 | 49.76점 |
| AutomationBench | 34.09% | 34.86% |
| DeepSWE v1.1 | 72.80% | 71.68% |
| Terminal-Bench 4.0 | 53.90% | 56.06% |
| Terminal-Bench Science 0.1 | 56.90% | 60.00% |
| BrowseComp | 87.92% | 87.35% |
| HealthBench Professional | 64.27% | 64.60% |
| GPQA Diamond | 94.44% | 93.94% |
텍스트 워터마크가 알려주지 않는 것 (What a text watermark doesn’t tell you)
텍스트 워터마크는 당사 시스템이 구절에서 수행한 역할에 대해 제한적인 신호만을 제공합니다. 탐지 결과로부터 무엇을 추론할 수 있고 무엇을 할 수 없는지 이해하는 것이 중요합니다.
- 워터마크는 인간의 기여도를 측정하지 않습니다. OpenAI 시스템이 구절의 일부를 생성하거나 처리했음을 나타낼 수는 있지만, 여기에 얼마나 많은 인간의 판단력, 편집 또는 창의성이 들어갔는지는 알려주지 않습니다.
- 워터마크는 소유권이나 책임을 확립하지 않습니다. 텍스트의 소유자가 누구인지, 사용이 합법적이었는지, 공개가 필요했는지, 혹은 누가 책임져야 하는지를 결정하지 않습니다.
- 워터마크는 사용자를 식별하지 않습니다. 사람, 조직, 계정, 프롬프트 또는 대화를 텍스트와 연관시키지 않습니다.
- 워터마크는 정확성을 검증하지 않습니다. 구절이 사실인지, 오해의 소지가 있는지, 유해한지, 혹은 올바른 맥락에서 제시되었는지 알려주지 않습니다.
감지된 워터마크가 없다고 해서 인간의 저작물임을 증명하지는 않습니다. OpenAI 도구로 생성된 텍스트는 너무 짧거나, 편집되었거나, 번역되어 있어 감지가 신뢰성 있게 작동하기 어려울 수 있습니다. 또한 지원되지 않는 모델에서 왔거나, 워터마킹 이전에 제작되었거나, 다른 회사의 도구에 의해 생성되었을 수도 있습니다.
향후 계획
EU 지역 텍스트 워터마킹 도입. 앞으로 몇 주 동안, EU 내 모든 플랜의 적격한 ChatGPT 및 Codex 사용자에게 텍스트 워터마킹 기능을 도입할 예정입니다. 출시 시점에 텍스트 워터마킹을 전 세계적인 기본 기능으로 만들지는 않을 것입니다. 이러한 지역적 접근 방식은 실제 사용 사례와 피드백으로부터 배울 수 있는 여지를 제공합니다.
API 고객 대상 선택적(opt-in) 워터마킹 활성화. 오늘부터 전 세계의 API 고객들은 일부 모델에 대해 워터마크가 적용된 텍스트 출력을 선택적으로 사용할 수 있게 됩니다. 이를 통해 고객들은 워터마킹이 자신들의 투명성 의무와 사용자에게 제공하는 경험에 어떻게 적합한지 결정할 수 있습니다. 또한, 저희는 클라우드 파트너들과 협력하여 향후 몇 주 안에 해당 서비스들을 통해 접근되는 OpenAI 모델 출력물에도 워터마킹을 적용할 수 있도록 작업하고 있습니다.
연구원 및 전문 기관에 탐지기(detector) 접근 권한 제공. 승인된 연구원과 전문 기관은 오늘부터 신청할 수 있습니다. 행동 강령(Code of Practice)에 따라, 텍스트 출처(text provenance) 평가와 개선을 지원하기 위해 초기에는 사례별로 접근이 허용될 것입니다. 이 도구는 사용자나 프롬프트 또는 대화를 식별하지 않고 OpenAI 워터마크가 감지되는지 여부만 보고합니다. 누락된 워터마크 및 오탐(false positives)의 위험성 때문에, 출시 시점에 이를 공개적으로 제공하지 않을 것입니다.
저희는 기술, 표준, 증거가 발전함에 따라 이 접근 방식의 각 부분을 재검토할 것으로 예상합니다.
콘텐츠 출처에 대한 저희의 광범위한 접근 방식
단일한 출처 기법만으로는 충분하지 않기 때문에, 저희는 개방형 표준(open standards), 영구 워터마킹(durable watermarking), 그리고 검증 도구를 결합하는 계층적 접근 방식을 취합니다.
저희가 설명한 선택적 보호 조치(selection safeguards) 작업에서처럼, 출처 정보(provenance)는 딥페이크를 포함하여 잠재적으로 오해의 소지가 있는 AI 생성 콘텐츠를 사람들과 플랫폼들이 평가하는 데 도움을 줄 수 있습니다. 저희는 이러한 신호들을 정책, 남용 탐지, 신고, 조사 및 집행과 결합하며, 출처 정보가 더 넓은 생태계 전반에 걸쳐 유용하도록 연구원들, 표준 기관들, 플랫폼들, 그리고 시민 사회와 협력하고 있습니다.
출처 정보를 텍스트로 확장하려면, 그것이 얼마나 쉽게 재작성되거나 번역되거나 편집될 수 있는지 고려해야 합니다. 지난 6월에 논의했듯이, 저희의 접근 방식은 현재 기술의 실질적인 한계를 반영해야 합니다. 저희는 탐지 기능을 계속 개선하고, 워터마크가 편집과 번역을 얼마나 잘 견디는지 연구하며, AI 지원(AI assistance)과 AI 작성(AI authorship)을 더 의미 있게 구별하는 방법을 모색할 것입니다. 증거, 표준, 규제 요구 사항이 발전함에 따라 저희의 접근 방식을 조정하고, 결과가 책임감 있게 해석될 수 있다고 판단될 때 탐지기 접근성을 확대해 나갈 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 OpenAI Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기