세계 최초의 이중 맹검(double-blind) AI 평가를 시범 운영하다
요약
본 기사는 AI 모델의 성능 평가에서 발생하는 '벤치마크 오염' 문제를 해결하기 위한 새로운 방법을 제시합니다. 외부 기관과 협력하여 암호학적 환경 내에서 독점적인 최첨단 AI 모델에 대한 세계 최초 이중 맹검(double-blind) 평가를 시범 운영하고 있습니다. 이는 테스트 전 모델이 문제에 접근하는 것을 원천적으로 차단하여 평가의 무결성과 신뢰도를 높이는 데 중점을 둡니다.
핵심 포인트
- AI 모델 평가는 '벤치마크 오염' 방지가 핵심 과제입니다.
- 암호학적 환경을 활용한 이중 맹검 평가를 시범 운영합니다.
- 싱가포르 AI 안전 연구소 등 외부 파트너와 협력하여 무결성을 높입니다.
- 모델의 실제 능력과 안전성 반영에 대한 신뢰 구축이 목표입니다.
암호학적으로 안전한 환경을 활용하여 독점 모델 벤치마크에 대한 신뢰 구축하기
학생이 중요한 시험을 치르게 된다고 상상해 봅시다. 만약 학생이 실수로 미리 시험 문제를 엿본다면, 완벽한 점수를 받는 것이 이 지식의 영향을 받게 되어 의미 없는 성취가 됩니다. 그들이 실제로 무엇을 알고 있는지 측정하려면, 시험을 볼 때까지는 문제에 대한 어떤 가시성도 없어야 합니다. 이것이 바로 업계가 고급 AI 모델을 평가할 때 직면하는 정확한 과제입니다. 만약 모델이 이미 시험 문제를 본 적이 있다면—벤치마크 오염(benchmark contamination)이라고 알려진 문제—결과는 어느 정도만 신뢰할 수 있습니다.
오늘, 저희는 독점적인 최첨단(frontier class) AI 모델의 세계 최초 이중 맹검 평가를 소개합니다. 이는 외부 평가가 암호학적 '상자' 안에 국한되도록 하여, 테스트에 앞서 성능을 최적화하는 데 모델들이 이를 사용하지 못하도록 합니다. 저희는 싱가포르 AI 안전 연구소(Singapore AI Safety Institute), OpenMined, AVERI, 그리고 MLCommons와 협력하여, 개인 정보 보호를 유지하는 환경에서 Gemini Flash Lite 모델을 기밀 벤치마크로 테스트함으로써 평가 무결성을 높이고 있습니다.
Google에서는 모델 개발 및 배포 전반에 걸쳐 광범위한 스펙트럼의 평가를 사용하여 AI 시스템을 평가하지만, 내부 테스트에만 의존하지는 않습니다. 잠재적인 사각지대를 파악하기 위해, 저희는 전문 연구소, 시민 사회 및 국가 AI 안전 보안 연구소(AISI) 등 다양한 외부 파트너들과 협력하며, 그들의 고유한 전문 지식을 활용하여 모델을 스트레스 테스트합니다.
AI 모델이 더욱 능숙해짐에 따라, 모델이 시험 문제나 프롬프트를 미리 본 적이 없도록 보장하는 것이 중요합니다. 왜냐하면 이것이 결과를 왜곡할 수 있기 때문입니다. 정책 입안자, 연구원, 기업들은 AI 벤치마크가 모델의 실제 능력과 안전성을 정확하게 반영한다고 신뢰해야 하지만, 만약 모델들이 평가 문제를 미리 '엿볼' 수 있다면, 점수가 인위적으로 부풀려져 이 신뢰를 저해할 수 있습니다.
비록 제로 로깅(zero-logging) 프로토콜과 엄격한 계약적 안전장치들이 오랫동안 외부 테스트 프롬프트를 기밀로 유지해 왔지만, 기술적 및 암호학적 안전장치를 통합하는 것은 보안 모델 평가에 있어 주요 진전입니다.
이중 맹검 평가는 어떻게 작동하는가
AI 자동 생성 콘텐츠
본 콘텐츠는 Google DeepMind의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기