UK AISI 사이버 평가, 프런티어 AI 거버넌스의 중심에 외부 테스트를 배치하다
요약
UK AISI가 Anthropic과 OpenAI의 프런티어 모델을 대상으로 독립적인 사이버 역량 테스트를 실시하며 AI 거버넌스의 새로운 기준을 제시하고 있습니다. 이는 모델 배포 전 통제된 환경에서 잠재적 위험을 평가하는 실질적인 메커니즘으로 자리 잡고 있습니다.
핵심 포인트
- UK AISI는 외부 독립 평가자로서 프런티어 모델의 사이버 역량을 검증함
- 모델의 안전장치와 근본적인 역량은 별개로 평가되어야 함
- 배포 전 평가(pre-deployment evaluation)가 핵심 거버넌스 수단으로 부상
- Anthropic과 OpenAI 모두 AISI의 조기 접근 및 테스트에 협력 중
UK AI Security Institute (AISI)는 프런티어 AI 시스템을 어떻게 거버넌스(governance)해야 하는가에 대한 논쟁의 중심에 독립적인 사이버 역량 테스트를 배치했습니다. Anthropic의 Claude Mythos 모델과 OpenAI의 GPT-5.6 Sol에 대한 AISI의 작업은, 평가자가 일반적인 공개 배포 시 적용되는 안전장치 이상의 접근 권한을 가질 때 고급 시스템이 통제된 사이버 작업에서 어떻게 수행되는지를 조사합니다.
가장 중요한 시사점은 단일 모델이 명확하게 정의된 임계값을 넘었다는 것이 아닙니다. 그것은 바로 외부의 배포 전 평가(pre-deployment evaluation)가 현실적이지만 통제된 환경에서 프런티어 모델이 무엇을 할 수 있는지 평가하기 위한 실질적인 거버넌스 메커니즘이 되고 있다는 점입니다. Anthropic과 OpenAI의 기업 자료는 Mythos급 및 GPT-5.6 시스템과 관련된 테스트에 AISI가 참여했음을 확인해주며, AISI는 Claude Mythos Preview의 사이버 역량에 대한 조사 결과를 발표했습니다.
Claude Mythos Preview의 사이버 역량에 대한 AISI의 평가는 제공된 증거 중 가장 명확한 공식 기록을 제공합니다. 연구소는 사이버 관련 역량을 테스트하도록 설계된 통제된 환경에서 모델을 평가했습니다. Anthropic 또한 Mythos 5가 신뢰할 수 있는 접근 권한을 가진 Project Glasswing 프로그램의 일환으로 UK AISI와 함께 외부 테스트를 거칠 것이라고 밝혔습니다. 이와 별개로, OpenAI의 GPT-5.6 System Card는 UK AISI가 배포 전 평가를 위해 GPT-5.6 Sol에 대한 조기 접근 권한을 받았다고 명시하고 있습니다.
이러한 차이점은 중요합니다. 공개적으로 문서화된 자료들은 서로 다른 모델 변체, 접근 방식, 그리고 평가 단계를 언급하고 있습니다. 그럼에도 불구하고 이들은 공통된 발전 방향을 가리키고 있습니다: AISI는 제한된 접근 프로그램 전이나 그와 병행하여, 프런티어 모델의 사이버 역량을 평가하는 독립적인 평가자로 활용되고 있습니다.
평가가 입증하는 것
현재 가용한 연구들은 신중한 결론을 뒷받침합니다. Mythos-family 모델과 GPT-5.6 Sol은 자율적 사이버 작업 및 시뮬레이션 환경을 포함한 통제된 테스트 환경에서 상당한 사이버 역량 (cyber capabilities)을 입증했습니다. 이러한 결과가 두 시스템 중 어느 하나가 공격적 사이버 용도로 광범위하게 배포되었다는 증거로 해석되어서는 안 되며, 통제된 테스트가 실제 세계의 피해를 직접적으로 측정하는 지표가 되는 것도 아닙니다.
대신, 이러한 평가는 특정 조건 하에서 모델이 무엇을 할 수 있는지 확립하는 데 도움을 주도록 설계되었습니다. 안전 팀 (safety teams)과 정책 입안자들에게는 모델이 일반적인 채팅 상호작용에서 안전해 보이는지 여부보다 이것이 더 유용한 질문입니다. 시스템이 도구 (tools), 확장된 작업 시간, 현실적인 환경을 갖추거나 배포 제한이 줄어들 경우 역량 (capability)은 변할 수 있습니다.
보고된 프로그램은 다음과 같은 몇 가지 거버넌스 (governance) 질문을 강조합니다:
- 모델의 안전장치 (safeguards)와 모델의 역량 (capability)은 서로 다른 것입니다. 모델의 일반적인 제품 안전장치는 사용자의 접근을 제한할 수는 있지만, 평가자가 평가해야 할 잠재적인 근본 역량을 제거하지는 못할 수 있습니다.
- 접근 조건이 평가 결과에 영향을 미칩니다. 신뢰할 수 있는 접근 (trusted-access) 계약, 조기 접근, 그리고 통제된 환경은 대중에게 공개된 인터페이스에서는 드러나지 않는 행동을 밝혀낼 수 있습니다.
- 독립적인 테스트는 기업의 시스템 카드 (system cards)를 보완할 수 있습니다. 개발자는 안전 평가에 대한 책임을 유지하지만, 외부 평가자는 별도의 검증 수단을 추가합니다.
- 결과에는 신중한 해석이 필요합니다. 시뮬레이션된 사이버 작업은 실제 운영 성능과 동일하지 않더라도 리스크 관리 (risk management)를 위한 관련 증거가 될 수 있습니다.
| 영역 | Anthropic 및 Claude Mythos | OpenAI 및 GPT-5.6 Sol |
|---|---|---|
| 제공된 연구에 문서화된 UK AISI 관계 | AISI가 Mythos Preview에 대한 결과를 발표했으며, Anthropic은 Mythos 5가 외부 AISI 테스트를 받을 것이라고 밝혔습니다. | OpenAI의 GPT-5.6 System Card는 AISI가 배포 전 평가를 위해 GPT-5.6 Sol에 조기 액세스했음을 보여줍니다. |
| ... |
AI 안전 정책에 이것이 중요한 이유
프런티어 AI 거버넌스는 종종 약속, 정책 및 발표된 안전 보고서에 초점을 맞춥니다. 이러한 것들은 여전히 중요하지만, AISI의 작업은 추가적인 계층의 가치를 보여줍니다: 구조화된 조건에서 모델을 독립적으로 테스트하고 그 결과를 개발자 및 정책 입안자에게 전달할 수 있는 평가자입니다.
모델 액세스 방식은 특히 중대한 의미를 갖습니다. Anthropic은 Project Glasswing에서 신뢰 액세스 테스트를 위해 사이버 안전장치가 해제되는 것을 설명했습니다. OpenAI는 GPT-5.6 Sol에 대한 AISI의 조기 액세스를 문서화했습니다. 두 경우 모두, 평가자의 역할은 단순히 소비자 제품 경험을 통해서가 아니라, 평가 중인 위험과 관련된 조건 하에서 시스템을 검사할 수 있는 능력에 달려 있습니다.
이는 배포된 제품의 강력한 안전장치가 필요하다는 필요성을 제거하지 않습니다. 오히려 안전장치는 시스템의 근본적인 기능(underlying capabilities), 액세스 제어(access controls) 및 의도된 배포 컨텍스트와 함께 평가되어야 함을 명확히 합니다.
고급 AI로 구축하는 조직에게 실질적인 교훈은 안전 평가를 규정 준수 문서(compliance document)가 아니라 구현 계획의 일부로 취급하는 것입니다. AI 기반 자동화, 에이전트 워크플로우(agent workflows) 또는 보안 민감 통합을 평가하는 조직은 처음부터 액세스 제어 및 거버넌스 요구 사항을 고려하여 Scalevise와 함께 AI 아키텍처, 워크플로우 설계 및 구현 선택에 대해 작업할 수 있습니다.
다음 정책 과제는 비교 가능성입니다. 평가가 가장 유용하려면 개발자 및 모델 세대 전반에 걸쳐 그 방법, 조건, 한계점 및 시사점을 이해할 수 있어야 합니다. 제공된 증거만으로는 이 모델들에 대한 단일한 보편적 벤치마크나 최종적인 위험 분류를 확립하지 못합니다. 다만, 독립적인 테스트가 프런티어 AI 출시의 운영 모델에 점점 더 포함되고 있음을 보여줍니다.
자주 묻는 질문 (FAQ)
UK AISI는 무엇을 평가했나요?
UK AISI는 통제된 환경에서 Claude Mythos Preview의 사이버 역량에 대한 평가를 발표했습니다. 제공된 연구는 또한 Mythos 5에 대한 AISI의 계획된 외부 테스트와 사전 배포 평가를 위한 OpenAI의 GPT-5.6 Sol 초기 접근을 문서화합니다.
Claude Mythos 5와 GPT-5.6 Sol이 이러한 평가를 통해 공개적으로 출시되었나요?
제공된 연구는 공유되는 공개 출시 상태가 아닌, 평가 및 접근 준비 상황을 문서화하고 있습니다. Anthropic은 신뢰 기반 접근 프로그램과 관련하여 Mythos 5를 설명했으며, OpenAI는 GPT-5.6 Sol에 대한 AISI의 초기 접근을 문서화했습니다.
일부 테스트에서 안전장치가 제거되거나 해제되는 이유는 무엇인가요?
평가자는 통제되고 승인된 조건 하에서 모델의 근본적인 역량을 검토해야 할 수 있습니다. 이는 제품 안전장치의 효과와 다른 접근 또는 배포 환경에서 중요할 수 있는 역량들을 분리하는 데 도움이 됩니다.
통제된 사이버 평가는 실제 세계의 사이버 피해를 증명하나요?
아닙니다. 통제된 과제와 범위 기반 시뮬레이션은 정의된 조건 하에서의 역량에 대한 증거를 제공할 뿐입니다. 이는 실제 세계 오용이나 운영상의 피해에 대한 증거와는 다릅니다.
결론
UK AISI의 Claude Mythos 및 GPT-5.6 Sol에 대한 작업은 프런티어 AI (Frontier AI) 감독에 대한 성숙해지는 접근 방식을 보여줍니다. 즉, 개발자는 제한적인 배포 전 또는 배포와 병행하여 독립적이고 통제된 테스트를 위한 접근 권한을 제공할 수 있습니다. 현재 가용한 증거는 상당한 사이버 역량(Cyber capability)에 대한 신중한 우려를 뒷받침하는 동시에, 테스트 조건, 안전장치(Safeguards), 그리고 접근 모델이 해당 역량을 어떻게 해석해야 하는지를 결정짓는 핵심 요소임을 강조합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기