조율된 모델 증류 캠페인 방해
요약
본 기사는 보호된 추론(protected reasoning)을 추출하려는 적대적 증류(adversarial distillation) 캠페인을 식별하고 차단한 내용을 다룹니다. 공격자들은 모델 상호작용 조작을 통해 내부 추론 과정을 체계적으로 재현하여, 다른 모델 학습에 활용할 수 있는 정보를 빼내려 했습니다. 이는 AI 시스템의 안전 및 국가 안보 위험과 관련되어 광범위한 방어력 강화가 필요함을 시사합니다.
핵심 포인트
- 적대적 증류는 보호된 추론을 추출하는 공격 방식입니다.
- 공격자들은 모델 상호작용 조작을 통해 정보를 빼내려 했습니다.
- 이러한 위험은 AI 시스템의 안전 및 국가 안보와 직결됩니다.
- 업계 파트너들과 정보 공유를 통한 집단 방어력 강화가 중요합니다.
최근 저희는 보호된 추론(protected reasoning)을 추출하기 위해 설계된 조율된 캠페인을 식별하고 이를 차단했습니다. 가장 초기에 관찰된 활동은 7월 첫 주에 발생했습니다. 이러한 활동은 적대적 증류(adversarial distillation)와 일치합니다. 이는 한 모델의 출력이나 추론 과정을 체계적이고 무단으로 사용하여 다른 모델을 학습시키거나, 재현하거나, 개선하는 행위를 의미합니다. 보호된 추론이란 모델이 작업을 처리하기 위해 내부적으로 거치는 기록이며, 이를 추출하면 최종 답변에 숨겨진 정보를 밝혀내고 다른 사람들이 해당 모델의 역량을 재현하도록 도울 수 있습니다.
운영자들은 저희의 암호화를 해제하거나, 데이터베이스를 손상시키거나, 저장된 사용자 대화에 직접 접근하지는 않았습니다. 대신, 그들은 모델 상호작용을 조작하여 보호된 추론이 요청자에게 노출되는 형태로, 서비스 약관을 위반하는 방식으로 체계적이고 규모 있게 재현될 수 있도록 했습니다. 이러한 조작은 OpenAI의 모델에만 국한된 취약점은 아니며, 저희는 업계 파트너들과 Frontier Model Forum을 통해 이와 관련된 정보를 공유하여 적대적 증류에 대한 집단 방어력을 강화하고 있습니다.
게시하기 전에, 저희는 그 범위와 잠재적 영향을 조사했고, 자체적인 완화 조치를 배포했으며, 이러한 유형의 공격에 대한 보호 장치가 마련되었는지 확인하기 위해 연구원 및 업계 파트너들과 정보를 공유하고 피드백을 받았습니다. 추가적인 완화 및 조사 작업은 계속 진행 중입니다. 저희는 지금 우리가 배운 것을 공유하는 것이 광범위한 생태계가 방어력을 강화하는 데 도움이 될 것이라고 믿습니다.
우리가 관찰한 것
저희는 운영자들이 한 대화에서 암호화된 추론을 복사하여 다른 대화의 모델에게 숨겨진 추론 내용을 해독하고 전사하도록 요청하는 등, 보호된 추론을 추출하려는 새로운 방식들을 시도하는 것을 목격했습니다.
독립적인 보안 연구원들(opens in a new window)은 책임 있는 공개(responsible disclosure)를 통해 관련 크로스-모델 및 대화 압축 취약점들을 저희에게 알려주었습니다. 저희는 그들의 발견 사항을 조사했고, 그들이 식별한 공격 경로가 실제로 존재한다는 것을 확인했습니다. 그들의 작업은 저희가 더 광범위한 공격 클래스를 이해하고 완화 조치를 가속화하는 데 도움을 주었습니다.
이러한 활동은 7월 1일에 시작되었으며, 초기에는 낮은 양이었으나 7월 24일과 25일에 걸쳐 4,000명 이상의 사용자로부터 관련 추출 패턴을 사용한 16,000건의 요청으로 높은 볼륨 급증이 관찰되었습니다. 추가 조사를 통해 15,000명 이상의 사용자 클러스터 전반에 걸친 관련 프롬프트 패턴 활동이 확인되었고, 저희는 이를 7월 28일까지 완전히 차단했습니다.
이러한 활동은 시간이 지남에 따라 진화했으며, 적대적 증류(adversarial distillation)가 계층적이고 적응적인 방어 체계를 필요로 하는 더 광범위한 보안 과제임을 재확인시켜 주었습니다.
저희의 출처 평가 (Our assessment of attribution)
관련 기간 동안 저희가 관찰한 모든 운영자가 단일 행위자로부터 유래했는지 여부는 불분명합니다. 하지만, 저희는 활동의 핵심 클러스터를 Kimi 개발사인 Moonshot AI와 관련된 개인들에게 돌립니다.
이것이 중요한 이유 (Why this matters)
적대적 증류는 안전 및 국가 안보 위험을 제기합니다. 추출된 추론은 원래 모델의 사용자 대상 출력물에 적용된 보호 장치를 유지하지 않은 채 다른 모델을 훈련하는 데 사용될 수 있습니다. 대규모로 진행될 경우, 증류는 안전에 대한 동일한 투자가 필요하지 않으면서도 고급 기능을 전파할 속도를 높일 수 있습니다. 이러한 우려는 모델이 이중 용도(dual use) 영역에서 역량을 갖추게 되면서 더욱 커집니다.
이러한 위험은 OpenAI만의 고유한 것이 아닙니다. 위에서 언급했듯이, 유사한 기술들이 다른 고급 AI 시스템에도 영향을 미칠 수 있으므로, 이는 업계 전반의 조율을 필요로 하는 공유된 보안 과제입니다.
저희가 대응한 방식 (How we responded)
저희는 계정 강제 조치(account enforcement), 기술적 통제(technical controls), 그리고 파트너 협력을 결합하여 최근의 증류 캠페인(distillation campaign)에 대응했습니다. 사기성 계정을 금지하거나 제한하고, 가입 및 인프라 통제를 강화했으며, 관련 네트워크에 대한 모니터링을 확대했습니다.
또한 사용자, 워크스페이스, 조직, 모델 패밀리 전반의 숨겨진 추론(hidden reasoning) 보호를 강화했습니다. 다른 사용자의 암호화된 추론을 이미 소유한 사람이 이를 재현하여 내용물을 복구할 수 있게 했던 경로를 차단하고, 추론을 노출할 수 있는 스트리밍 출력물(streamed output)을 감지하고 보류하는 검사 기능을 추가했습니다. 관련 활동이 제3자 서비스(third-party services)를 통해 이동했을 때는 해당 제공업체와 협력하여 관련된 계정을 식별하고 방해했습니다.
마지막으로, 다른 프론티어 개발자 및 공공 부문 파트너들이 유사한 활동을 찾고 자체적인 방어를 강화할 수 있도록 관련 조사 결과를 Frontier Model Forum과 적절한 정부 정보 공유 채널을 통해 공유했습니다. 휴대 가능하거나 재현 가능한 추론 아티팩트(replayable reasoning artifacts)를 지원하는 시스템은 관련된 위험에 직면할 수 있습니다.
앞으로의 계획 (What comes next)
프론티어 모델이 개선되고 행위자들이 역량 모방을 위한 더 저렴한 방법을 찾음에 따라, 적대적 증류 시도(adversarial distillation attempts)는 더욱 정교해질 것으로 예상됩니다. 이러한 활동에 방어하기 위해서는 계층적인 통제와 지속적인 적응이 필요합니다.
이 작업은 끝나지 않았습니다. 파트너가 호스팅하는 배포 환경 역시 퍼스트파티 서비스(first-party services)와 동일한 보호를 받아야 하며, 도구 출력 공격(tool-output attacks)에는 일반적인 가시적 텍스트 이상의 것을 검사해야 하는 보호 장치가 필요합니다. 저희는 도구 방어(tool defenses), 분류기 커버리지(classifier coverage), 모델 거부(model refusals)를 지속적으로 개선하고 관련 통제를 클라우드 파트너들에게 전파할 것입니다.
저희의 대응은 다음 세 가지 영역에 계속 초점을 맞출 것입니다: 추출에 대한 더 강력한 기술적 보호, 조정된 캠페인에 대한 더 나은 탐지 및 시행(enforcement), 그리고 업계와 정부 간의 심층적인 위협 정보 공유입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 OpenAI Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기