
UK AISI / CAISI의 Kimi K3 사이버 역량 예비 평가
요약
영국 AISI와 미국 CAISI가 Moonshot AI의 Kimi K3 모델에 대해 수행한 사이버 보안 역량 예비 평가 결과입니다. ExploitBench를 통해 Kimi K3의 소프트웨어 익스플로잇 개발 능력을 측정하고 미국 및 중국 프런티어 모델들과 비교 분석했습니다.
핵심 포인트
- Kimi K3는 2026년 6월 기준 가장 뛰어난 사이버 역량을 가진 오픈 웨이트 모델임
- ExploitBench를 통해 소프트웨어 익스플로잇 사다리 단계별 수행 능력을 검증함
- 미국 프런티어 모델과 중국 모델 간의 사이버 역량 추세를 비교 분석함
- IRT(문항 반응 이론) 기반의 접근 방식으로 모델의 종합 역량을 집계함
영국 인공지능 보안 연구소 (UK AISI)와 미국 AI 표준 및 혁신 센터 (CAISI) (UK AISI / CAISI)는 Moonshot AI의 최신 모델인 Kimi K3(2026년 7월 16일 출시되었으며, 2026년 7월 27일까지 오픈 웨이트 (open-weight) 출시 예정)에 대한 공동 평가를 수행했습니다. 이 평가는 Kimi K3의 사이버 역량에 초점을 맞추었으며 다음과 같은 결과를 도출했습니다:
그림 1: 익스플로잇 개발 벤치마크 (ExploitBench)에서의 Kimi K3 및 기타 모델의 성능. 성공률이 높을수록 사이버 역량이 더 큼을 나타냅니다. 오차 막대는 95% 신뢰 구간을 나타냅니다. ExploitBench는 취약점이 주어졌을 때 모델이 엔드 투 엔드 (end-to-end) 익스플로잇을 개발하는 능력을 측정합니다.
이 결과는 소수의 공개 및 비공개 벤치마크 세트에 대한 예비 평가를 나타냅니다. 미국의 폐쇄형 웨이트 (closed-weight) 모델들은 거부 반응을 줄이고 최대 역량을 측정할 수 있도록 시스템 수준의 안전장치 (safeguards)를 비활성화한 상태에서 평가되었습니다. 이러한 모델들의 공개적으로 사용 가능한 버전에는 이러한 안전장치가 활성화되어 있습니다. Kimi K3의 호스팅 설정 특성상, UK AISI / CAISI는 선택된 사이버 평가 세트를 실행했습니다. 상세한 방법론은 개별 섹션에 제공됩니다.
모델의 사이버 역량은 문항 반응 이론 (Item Response Theory, IRT)에서 영감을 얻은 접근 방식을 사용하여 여러 벤치마크의 여러 작업에 걸쳐 집계됩니다. 방법론에 대한 자세한 내용은 이전에 발표된 보고서를 참조하십시오. Kimi K3의 전반적인 사이버 역량은 단일 벤치마크 (익스플로잇 개발에 집중된 41개 작업이 포함된 ExploitBench)로부터 추정되었기 때문에 다른 모델보다 신뢰 구간이 더 큽니다. ExploitBench는 모델이 소프트웨어 익스플로잇 사다리 (software exploitation ladder)를 따라 진행하는 능력을 측정하는 선도적인 벤치마크입니다. 다른 모든 모델의 전반적인 사이버 역량 점수는 사이버 역량의 추가 영역을 다루는 더 많은 수의 작업으로부터 도출되었습니다.
Figure 2: Kimi K3 출시 시점을 기준으로 한 미국 및 중국(PRC) 최상위 모델들의 시간 경과에 따른 종합 역량 예비 비교. 미국의 추세선은 미국의 프런티어 (frontier) 모델들의 결과로 구성됩니다. y축의 400포인트 증가는 과제 해결 확률이 10배 증가함을 의미합니다. 오차 막대(Error bars)와 음영 영역은 95% 신뢰 구간 (CIs)을 나타냅니다.
ExploitBench는 Carnegie Mellon University에서 개발한 공개 벤치마크로, 커버리지 및 크래시 재현 (crash reproduction), 임의 읽기/쓰기 (arbitrary read/write), 제어 흐름 탈취 (control flow hijack), 임의 코드 실행 (arbitrary code execution)을 포함하여 소프트웨어 익스플로잇 사다리 (software exploitation ladder)를 따라 진행하는 모델의 능력을 측정합니다. 이 벤치마크는 V8 엔진(Chrome을 구동하는 JavaScript 및 WebAssembly 소프트웨어)의 최근(2023년 이후) 취약점 41개에 대해 모델을 테스트합니다.
ExploitBench 결과는 Figure 1 및 Figure 3에 제시되어 있습니다.
Figure 3: Kimi K3 및 기타 모델의 상세 ExploitBench 성능. 음영이 어두울수록 더 높은 사이버 역량을 나타냅니다. 각 행은 익스플로잇 개발 체인의 주요 마일스톤을 나타내며, 각 셀은 해당 모델이 해당 마일스톤에 도달할 수 있었던 ExploitBench 과제의 수를 보여줍니다.
Kimi K3는 2026년 6월 기준 가장 사이버 역량이 뛰어난 오픈 웨이트 (open-weight) 모델인 GLM-5.2를 능가합니다. Kimi K3는 32%의 점수를 달성한 반면, GLM-5.2는 24%의 점수를 달성했습니다 (Figure 1).
가장 사이버 역량이 뛰어난 모델들과 달리, Kimi K3는 ExploitBench 과제에서 임의 코드 실행 (ACE)을 달성하는 익스플로잇 개발에 실패했습니다. ACE는 익스플로잇 개발에서 가장 심각도가 높은 결과로, 공격자에게 타겟을 탈취할 수 있는 권한을 부여합니다. Kimi K3는 41개 샘플 중 0개에서 ACE를 달성한 반면, 가장 사이버 역량이 뛰어난 모델들은 평균적으로 41개 샘플 중 20개에서 ACE를 달성했습니다 (Figure 3).
“The Last Ones” (TLO) 사이버 레인지 (cyber range)는 4개의 서브넷 (subnets)과 약 20개의 호스트 (hosts)에 걸쳐 진행되는 32단계의 시뮬레이션된 기업 네트워크 공격으로, 인간 전문가가 완료하는 데 약 20시간이 소요됩니다. 사이버 레인지 (cyber ranges)는 전문가가 구축한 호스트, 서비스, 취약점의 시뮬레이션된 네트워크로, 초기 네트워크 접속 시점부터 시작되는 순차적인 공격 체인 (attack chains)으로 구성되며, 모델이 엔드 투 엔드 (end-to-end) 사이버 공격을 자율적으로 수행할 수 있는 능력을 측정하는 데 사용될 수 있습니다.
이 평가에서 Kimi K3는 미국의 선도적인 사이버 역량 보유 모델들보다 현저히 낮은 성능을 보였습니다. 구체적으로, Kimi K3는 이 32단계 공격 경로 중 평균 17단계에 도달한 반면, 가장 사이버 역량이 뛰어난 미국 모델들은 평균 28.5단계에 도달했습니다.
Kimi K3는 2026년 6월 기준 가장 사이버 역량이 뛰어난 오픈 웨이트 (open-weight) 모델인 GLM-5.2보다 우수한 성능을 보입니다. 100M 토큰 제한 내에서 Kimi K3는 평균 17단계에 도달한 반면, GLM-5.2는 11단계에 도달했습니다.
10번의 시도 중 한 번, Kimi K3는 100M 토큰 제한 내에서 “The Last Ones” 사이버 레인지를 성공적으로 완료했습니다. 이는 Kimi K3가 지시를 받고 초기 네트워크 접속 권한이 주어졌을 때, 방어 체계가 약하고 취약한 소규모 기업 시스템을 자율적으로 공격할 수 있음을 나타냅니다. 그러나 TLO는 몇 가지 측면에서 실제 환경과 다릅니다. TLO에는 능동적인 방어자나 방어 도구가 없으며, 보안 경고를 트리거할 수 있는 행동에 대한 페널티가 부과되지 않고, 의도적인 공격 경로를 포함하고 있습니다.
TLO의 해결은 더 이상 소수의 모델에만 국한되지 않습니다. 이전 테스트에서 공개된 4개의 클로즈드 웨이트 (closed-weight) 모델이 TLO를 해결했으며, 가장 뛰어난 모델들은 10회 시도 중 6/10 및 7/10의 확률로 더 안정적으로 해결했습니다. Kimi K3는 표준 100M 토큰 제한 내에서 10회 시도 중 1/10의 확률로 이를 해결했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기