6개의 오픈 소스 AI 펜테스터, 하나의 OWASP Juice Shop, 순위 매기기 (재현 가능)
요약
OWASP Juice Shop 환경에서 6개의 오픈 소스 AI 펜테스터 성능을 비교한 재현 가능한 벤치마크 결과입니다. Darkmoon이 블랙박스 테스트에서 57개의 취약점을 탐지하며 다른 도구들보다 압도적인 성능을 기록했습니다.
핵심 포인트
- 동일한 Docker 환경(OWASP Juice Shop)을 통한 공정한 비교 수행
- Darkmoon이 28.5분 만에 57개의 취약점 탐지 및 공격 증명 성공
- 기존 도구(PentestGPT 등)와의 성능 격차 확인
- 누구나 재현 가능한 오픈 소스 벤치마크 리더보드 지향
공개 사항: Darkmoon은 제 프로젝트입니다. 하지만 이것은 재현 가능한 벤치마크이며, 제가 조작할 수 있는 순위가 아닙니다. 직접 실행해 보세요.
질문
모든 AI 펜테스터(pentester)는 서로 다른 조건 하에서 헤드라인 수치를 발표합니다. 그래서 저는 조건을 고정했습니다: 동일한 공개 실험실 (OWASP Juice Shop, 기본 docker 이미지), 블랙박스 (black-box), 공개된 방법론.
현재까지의 결과
Darkmoon, 블랙박스 (black-box), 로컬 LLM 사용: 28.5분 만에 57개의 탐지 결과 (Critical 8개, High 24개, Medium 21개, Low 4개)를 기록했으며, 탐지 결과당 취약점 공격 증명 (proof of exploitation)을 수행했습니다. 실행 횟수가 누적됨에 따라 결과는 14, 28, 38, 44, 49, 57로 증가했습니다.
다른 도구들 (strix, shannon, PentAGI, PentestGPT, CAI)은 "실행 대기 중" 행에 머물러 있습니다. 이것이 정직한 부분입니다. 저는 그들의 수치를 지어내지 않을 것입니다. 이것은 커뮤니티 리더보드(leaderboard)입니다. 여러분이 좋아하는 도구를 동일한 이미지에 대해 실행하고 PR을 보내주세요.
공개 실험실에서 블랙박스 (black-box)를 사용하는 이유
누구나 검증할 수 있는 유일한 설정이기 때문입니다. 자체적으로 정제된 검증 데이터셋(validation set)에서의 화이트박스 (white-box) 수치는 인상적이지만 비교할 수는 없습니다. 공개 이미지와 문서화된 방법론은 반증 가능하며, 이것이 벤치마크의 핵심입니다.
재현 또는 도전
docker run -p 3000:3000 bkimminich/juice-shop을 실행한 다음, 도구를 실행하세요. 전체 방법론 및 원본 출력 결과는 여기에서 확인할 수 있습니다: https://github.com/ASCIT31/Darkmoon-Benchmarks
여러분의 도구가 Juice Shop에서 57개의 블랙박스 (black-box) 탐지 결과를 뛰어넘는다면, 저는 그 PR을 원합니다. 만약 그렇지 않더라도, 그것 또한 유용한 데이터입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기