직접 만든 사이버 보안 벤치마크로 Qwen3.8 27B를 실행해 본 결과: 로컬 모델의 해킹 능력 분석
요약
작성자는 사이버 보안 벤치마크를 통해 Qwen3.8 27B와 같은 로컬 모델의 해킹 능력을 분석했습니다. Pwn, 웹, 암호화 등 실제 CVE 기반 과제에 총 19개의 과제를 적용하여 여러 모델을 테스트했으며, 특히 API 기반 모델들이 높은 성능을 보였습니다. 로컬 환경에서는 Proxmox 노드 두 대(3090 및 3080)를 사용하여 Qwen3.8 27B를 구동하며 충분한 동시 처리량을 확보했습니다.
핵심 포인트
- 사이버 보안 벤치마크는 Pwn, 웹 등 실제 CVE 기반 과제로 구성됨.
- 로컬 모델(Qwen3.8 27B)은 오픈 모델임에도 높은 사이버 보안 능력을 보였음.
- API 기반의 상용 모델들(MiMo 2.6 Flash, GPT-6 Luna)이 다단계 과제에서 우수한 성능을 기록함.
- 로컬 환경 구축 시 여러 GPU를 활용하여 충분한 동시 TPS 확보가 가능함.
안녕하세요, 로컬 AI 커뮤니티 여러분. 오랫동안 작업해 온 내용이라 이제야 공유하게 되었습니다. 이 내용은 모델이 격리된 Docker 박스 내에서 셸(shell)을 얻은 후 정확한 플래그(flag)를 찾아내야 하는 사이버 보안 벤치마크입니다. Pwn, 웹(web), 암호화(crypto), 리버스 엔지니어링(rev), 포렌식(forensics) 등 실제 CVE 몇 가지와 여러 단계가 필요한 범위(multi-stage ranges)로 구성되어 있습니다. 총 19개의 과제에 대해 6개 모델이 544번의 시도를 거쳐 점수를 얻었습니다. 분명히 말씀드리자면, 모든 과제를 직접 손으로 만든 것은 아닙니다. GLM 5.3 덕분에 여러 과제를 만드는 데 도움을 받았습니다. 오픈 모델임에도 불구하고 사이버 보안 능력이 매우 높았고, 거의 어떤 것도 거부하지 않았기 때문에 이 테스트에 가장 적합한 옵션 중 하나였습니다. 다만, GLM 5.3은 이번 벤치마크 대상 모델에는 포함되지 않습니다.
로컬 환경의 경우: 저는 llama.cpp RPC 풀을 사용하여 Proxmox 노드 두 대(3090 및 3080 사용)에 걸쳐 Qwen3.8 27B (Unsloth Q4_K_XL, xhigh)를 연결된 2.5G 링크로 실행했습니다. 이를 통해 여러 에이전트를 동시에 실행할 수 있는 충분한 동시 TPS(transactions per second)를 확보할 수 있었습니다. 또한 낮은 추론(low reasoning) 테스트도 시작했지만, 하네스 문제 때문에 20시간 이상이 걸려 중단했습니다.
지금 이 글을 올리는 이유: John Hammond가 위협 행위자들이 AI를 어떻게 사용하는지에 대한 비디오(https://www.youtube.com/watch?v=xHDc6-7bjyw)를 공개했기 때문입니다. 그 영상에는 범죄 포럼에서 RunPod에 abliterated 모델을 실행하는 가이드 중 하나가 포함되어 있었고, 그 모델들 중 하나가 바로 Qwen3.8 27B였습니다. 저는 이 정확한 모델에 대한 벤치마크 데이터를 가지고 있었기 때문에, 실제로 이 모델이 무엇을 할 수 있는지 보여드리고자 합니다.
순정(Stock) Qwen3.8 27B는 첫 시도에 28.1%를 기록했고 Pwn에서는 0%였습니다. 두 개의 게이밍 카드에서 구동되는 27B 모델치고는 나쁘지 않지만, 그 자체만으로는 큰 위협이 되기 어렵습니다.
저렴한 API 기반 모델들은 이야기가 다릅니다:
- MiMo 2.6 Flash: 첫 시도에 73.7%를 해결했습니다.
- GPT-6 Luna: 3번의 시도 내에 90.9%를 해결했습니다.
- 여러 단계를 연결해야 하는 multi-stage ranges에서는 최고 모델들이 92~96%를 기록했습니다. Pwn은 여전히 모두에게 어려운 분야입니다 (최고 점수 56%) 또한, 82번의 시도에도 불구하고 어떤 모델도 해결하지 못한 과제가 3개 있습니다.
결과: https://lbgos.dev/bench
Harness (MIT): https://github.com/lbgos/rangebench-harness
이 과제들은 공개되지 않아 학습 데이터로 유출될 염려는 없지만, 여전히 실행해 볼 수 있습니다. 여기나 X(lbgosna)로 DM 주시면 보내드리겠습니다.
직접 하드웨어 또는 토큰으로 실행한 결과를 알려주시면 제가 보드에 추가하겠습니다. 몇 분이 로컬 실행 결과를 보내주신다면, 저는 별도의 로컬 전용 표를 만들겠습니다. 이것은 제가 이런 것을 처음 만들어보는 것이니, 방법론이나 작업 구성(task mix), 혹은 빠진 부분에 대한 모든 피드백을 환영합니다. /u/lbgos_Loss783 님이 r/LocalLLaMA 에 제출함 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기