
안전 장치를 제거한 LLM은 현재 누가 판매하고 있는가
요약
Kimi K3와 같은 대규모 오픈 소스 모델의 가중치를 직접 조작하여 안전 장치를 제거하는 'abliteration' 기술과 그 시장 구조를 분석합니다. 검열 없는 프론티어 모델의 API 판매가 어려운 경제적 이유와 보안 위협에 대해 다룹니다.
핵심 포인트
- abliteration은 추가 학습 없이 가중치 조작만으로 거부 기능을 제거하는 기술임
- 검열 없는 모델의 API화가 어려운 핵심 이유는 윤리가 아닌 원가 문제임
- 모델 내부의 잔차 스트림(residual stream) 조작을 통해 안전 장치 해제 가능
- 보안 담당자와 AI 도입 개발자가 인지해야 할 새로운 위협 모델 제시
2026년 7월 말, Kimi K3의 가중치(weights)가 공개되었습니다.
2.8조 파라미터라는, 오픈 소스 모델로서는 최대급인 모델입니다.
그리고 가중치가 공개되기 전후 며칠 사이에, 그로부터 안전 장치(safety mechanism)를 제거한 버전이 Hugging Face에 올라왔습니다.
여기서 궁금해진 점은, "그렇다면 그것을 API로서 판매하고 있는 업체는 어디에 있는가"였습니다.
검열 없는 프론티어 모델(frontier model)을 종량제로 사용할 수 있다면, 피싱 메일 자동 생성 등 무엇이든 공격 측의 도구 체계는 한 단계 격상될 것입니다.
찾으러 나섰습니다.
결론부터 말하자면, 찾을 수 없었습니다.
그리고 찾을 수 없었던 이유가, 찾고 있던 것보다 더 흥미로운 이야기였습니다.
이유는 윤리도 규제도 아닌, 단순한 원가 때문입니다.
이 기사에서는 다음 네 가지를 다룹니다.
abliteration(아브리테레이션, 모델의 가중치를 직접 조작하여 거부 기능을 제거하는 수법)이 프롬프트에 의한 탈옥(jailbreak)과 결정적으로 무엇이 다른가
- "검열 없는 LLM의 API 업체"를 4개 층으로 나누어 보면 어디에 무엇이 있는가
- 프론티어급 검열 없는 모델을 아무도 API화하지 않는 이유와 그 균형이 언제 깨질 것인가
- 그리고 일본어권 독자에게 가장 실질적인 해가 되는 결론, "일본어가 부자연스러우니까 수상하다"라는 판단 기준이 이미 효력을 상실했다는 점
보안 담당자, 생성 AI를 업무에 도입하고 있는 개발자, 그리고 사내 주의 환기 문구를 작성하는 입장에 있는 분들을 독자로 상정하고 있습니다.
조사 과정에서는 실제로 판매되고 있는 범죄 특화 도구의 이름이나, 그 입수 경로에 관한 정보도 등장했습니다.
이 중, 실제 구매 경로(live purchase path)는 싣지 않습니다.
.onion 주소, Telegram 초대 링크, 숍 이름의 직링크, 요금제 등록 절차 등입니다.
방범을 목적으로 하는 기사에 이러한 것들은 필요하지 않으며, 전재될 경우 경로의 재배포에 불과하기 때문입니다.
싣는 내용은 기술적인 메커니즘, 시장의 구조와 경제, 이미 위협 인텔리전스(threat intelligence) 공개 리포트에 이름이 올라와 있는 브랜드, 그리고 방어 측이 취할 수 있는 행동입니다.
한 가지 더, 조사 방법의 한계를 미리 밝힙니다.
이번 조사는 공개 정보만으로 진행되었으며, 다크웹 내부를 직접 관측하지는 않았습니다.
따라서 후술하는 "없었다"는 공개 정보의 범위 내에서 확인되지 않았다는 의미이며, 부재의 증명은 아닙니다.
본문에서는 1차 정보 또는 복수의 독립된 소스에서 일치하는 사실을 "확도 높음", 단일 소스나 2차 정보에 머무는 것을 "확도 중간"으로 구분하여 작성합니다.
출발점은 Arditi 등이 NeurIPS 2024에서 발표한 논문 「Refusal in Language Models Is Mediated by a Single Direction」입니다1. (확도 높음)
이 논문이 보여준 것은, 72B급까지의 주요 오픈 소스 채팅 모델 13종에서 "거부"라는 행동이 모델 내부의 1차원적인 방향으로 집약되어 있다는 것이었습니다.
모델이 각 층에서 읽고 쓰는 내부 표현(잔차 스트림, residual stream)에서 그 방향의 성분을 제거하면, 모델은 유해한 지시를 거부하지 않게 됩니다.
반대로 그 방향을 강화하여 더하면, 완전히 무해한 지시조차 거부 반응을 보이게 됩니다.
여기서 핵심은, 이 조작은 추가 학습(fine-tuning)이 아니라는 점입니다.
가중치에 대한 직접적인 선형 조작만으로 충분합니다.
즉, 대량의 학습 데이터가 필요하지 않고, 대규모 계산 자원도 필요하지 않으며, 모델의 일반적인 성능을 거의 떨어뜨리지 않고 수행할 수 있습니다.
이 논문 이후, 안전 장치 해제는 연구자의 영역에서 정해진 절차를 따르는 작업으로 내려왔습니다.
abliteration이라는 명칭도 이 무렵부터 퍼지기 시작했습니다2.
생성 AI의 안전 장치를 제거하는 이야기라고 하면, 많은 사람은 "교묘한 질문을 통해 거부를 우회하는" 탈옥(jailbreak)을 떠올릴 것입니다.
abliteration은 그것과는 다른 계층의 이야기입니다.
| 관점 | 탈옥 (프롬프트) | abliteration (가중치 개변) |
|---|---|---|
| 다루는 대상 | 입력 텍스트만 | 모델의 가중치 그 자체 |
| ... |
방어 측에 유효하게 작용하는 것은 아래의 두 줄입니다.
하나는, 패치(patch)가 전달되지 않는다는 점입니다.
프롬프트에 의한 회피는 제공 측에서 모델이나 필터를 업데이트하면 막을 수 있습니다.
가중치가 수정된 파생 모델은 제공 측의 관리 하에 있지 않습니다.
오픈 웨이트(open weights)로 공개된다는 것은, 그 모델의 안전 장치를 누구라도 영구적으로 제거할 수 있는 상태로 만든다는 의미이기도 합니다.
또 하나는 흔적이 남지 않는다는 점입니다.
입력은 완전히 자연스러운 문장이므로, 입력 필터(Input Filter)로는 걸러낼 수 없습니다.
사용자의 GPU에서 구동되고 있는 한, 그곳에서 무엇이 생성되었는지 외부에서 관측할 방법은 없습니다.
다만, 「단일 방향(Single Direction)」이라는 설에는 반증도 존재합니다.
2026년의 논문 「There Is More to Refusal in Large Language Models than a Single Direction」은 거부(Refusal)가 단일한 방향으로만 환원될 수 없다고 주장합니다3. (확도 중. 존재는 확인했으나, 본문을 정독하지는 않았습니다)
이는 이후의 이야기로 이어집니다.
공개된 abliterated 모델이 자칭하는 「안전 장치 제거율(Safeguard Removal Rate)」은 80%, 97%, 98.6% 등으로 제각각입니다.
거부가 깔끔하게 1차원으로 정렬되지 않는다면, 제거되지 않고 남는 부분이 생기는 것은 당연합니다.
안전 기제(Safety Mechanism)의 제거는 현재로서는 완전하지 않습니다.
Kimi K3는 Moonshot AI가 2026년 7월에 공개한 모델입니다.
공표된 제원은 다음과 같습니다. (확도 높음)
| 항목 | 내용 |
|---|---|
| 발표 | 2026-07-17 |
| ... |
가중치(Weights) 공개는 7월 말.
한편, abliterated 버전의 공개 공지는 그 이전인 7월 18일 시점에 이미 나와 있었습니다.
현재 Hugging Face 상에는 적어도 2계통이 존재합니다. (확도 높음)
| Uniboshi/Kimi-K3-Abliterated-V1 | audnai/penclaw-Kimi-K3.0-abliterated-GGUF |
|---|---|
| 공개 형태 | Hugging Face (연락처 공유 동의 필요) |
| ... |
일본어권 독자에게 중요한 점은, 한쪽이 일본어로 된 거부 억제를 명시적으로 튜닝 대상에 포함하고 있다는 것입니다.
이는 단순히 「대상 언어에 일본어가 포함되어 있다」는 것 이상의 의미를 갖습니다.
그 이야기는 후반부에서 정리하겠습니다.
무검열(Uncensored) 모델을 배포하는 측도, 이를 API로 판매하는 사업자도, 마치 판에 박은 듯 똑같은 설명을 합니다.
인가된 레드팀(Red Teaming) 연습이나 보안 연구를 위한 것이라는 설명입니다.
이 명분은 아주 말이 안 되는 것은 아닙니다.
공격 시나리오 생성, 피싱 훈련 문구 작성, 취약점 검증 보조와 같은 상황에서 범용 모델의 거부 기능이 방해가 되는 경우는 실제로 존재합니다.
저 자신도 취약점 검증을 자동화하는 작업에서 비슷한 벽에 부딪힌 적이 있습니다.
문제는 그 명분을 담보할 메커니즘이 존재하지 않는다는 점입니다.
「연락처 공유 동의」나 「신청 양식」은 신고 내용을 검증할 수단이 없습니다.
조직 소속 확인도, 업무 실태 확인도 없는 이상, 이것은 심사가 아니라 마찰을 한 단계 늘린 절차에 불과합니다.
기술적으로도 정합하지 않습니다.
「그레이 존(Gray Zone)의 거부만 낮추고, 정말 유해한 요구에는 거부를 유지한다」라는 주장이 자주 덧붙여지지만, abliteration은 거부라는 단일한 공통 축을 파괴하는 기법입니다.
축 자체를 지워놓고 그 축 위에 있는 요구사항을 골라내는 것은 원리적으로 어려울 수밖에 없습니다.
자칭 제거율이 98.6%라는 숫자 자체가, 이것이 선택적이지 않음을 보여줍니다.
「무검열 LLM API 업체」를 하나의 덩어리로 파악하면 실체를 놓치게 됩니다.
합법성, 기술적 기반, 제공 형태에 따라 나누면 4개의 층(Layer)이 되며, 층마다 취해야 할 대책이 다릅니다.
OpenRouter, Fireworks, Baseten, Together, Moonshot 공식 등이 순수한 Kimi K3를 호스팅하고 있습니다.
가격은 100만 토큰당 입력 $3, 출력 $15 정도입니다.
본인 확인, 결제, 이용 약관, 로그가 존재하며, 안전 기제는 그대로 유지된 상태입니다. (확도 높음)
이곳은 문제의 핵심이 아닙니다.
다만 나중에 나올 「원가」의 기준선으로서 중요합니다.
법인 대상의 형태를 갖추고, OpenAI 호환 API를 종량제 또는 정액제로 제공하는 사업자 그룹입니다.
무검열 모델을 다룬다는 사실을 숨기지 않습니다.
그러면서도 본인 확인에 대한 기재가 없으며, 「Zero Data Retention」(입력과 출력 모두 저장하지 않음)을 셀링 포인트로 내세웁니다. (확도 중~높음)
이 계층이 이번 조사에서 가장 많이 걸려들었습니다.
자세한 내용은 후술하겠습니다.
WormGPT v4, GhostGPT, FraudGPT, Xanthorox와 같은 이름으로 다크웹 포럼에서 홍보되며, 결제 후 Telegram 봇으로 초대받는 형태가 주류입니다.
가격대는 GhostGPT가 주당 $50, Xanthorox가 월 $300, 상위 계층은 수천 달러에 달합니다. (확도 높음)
기술적인 실체는 미미한 것으로 알려져 있습니다.
Rapid7은 2026년 6월 분석에서, 이 계층의 제공물에 대해 "대부분 공격자가 만든 독자적인 기반 모델(Foundation Model)이 아니라, 탈옥(Jailbreak), 상용 서비스의 래퍼(Wrapper), 파인튜닝(Fine-tuned)된 오픈 웨이트(Open-weight), 재패키징된 UI, 혹은 이들의 조합이다"라고 결론지었습니다4.
정규 서비스에 대한 액세스 권한 그 자체를 재판매하는 것입니다.
Kaspersky는 2024년 12월 시점에, 도난당한 OpenAI 계정이 1건당 $5에 판매되고 있음을 보고했습니다5. (확도 높음)
Rapid7은 이 계층을 과소평가되고 있는 중요한 세그먼트라고 규정하고 있습니다.
그 이유는 도난당한 계정이 단순히 무료 추론(Inference)을 제공하는 데 그치지 않기 때문입니다.
피해 조직이 AI 워크스페이스에 둔 프롬프트(Prompt), 업로드한 파일, 소스 코드, 고객 데이터, 회의록에 대한 액세스 권한이 통째로 상대방의 손에 넘어갑니다.
게다가 추론 비용은 피해자가 부담합니다.
abliterated 버전의 Kimi K3를 API로 판매하는 업체는 확인되지 않았습니다. (NOT FOUND)
Hugging Face 상의 해당 리포지토리(Repository)는 모두 "호스트 중인 추론 프로바이더: 없음"으로 표시되어 있습니다.
계층 ③의 범죄 특화 브랜드에 대해서도, 공개된 위협 인텔리전스(Threat Intelligence) 보고서에서 K3 계열을 기반으로 한다는 기술은 나오지 않습니다.
헛수고였지만, 구조를 살펴보니 헛수고를 하는 것이 당연했다는 것을 알 수 있습니다.
계층 ③에는 그런 무거운 모델을 돌릴 능력도 동기도 없으며, 계층 ②는 애초에 숨을 필요가 없으므로 클리어 웹(Clear Web)에 존재합니다.
"다크웹에서 검열되지 않은 최신 모델이 팔리고 있다"라는 시나리오를 가지고 찾아다니면, 실제로 존재하는 시장을 통째로 놓치게 됩니다.
왜 계층 ③은 K3에 손을 대지 않는가?
윤리나 규제 때문이 아니라, 계산이 맞지 않기 때문입니다.
먼저, K3를 구동하는 데 무엇이 필요한지 살펴보겠습니다. (확도 중~높음)
| 항목 | 수치 |
|---|---|
| 가중치(Weights) 크기 | MXFP4 양자화(Quantization) 시 약 594GB 다운로드, 전개 후 1.4~1.56TB |
| ... |
이러한 수치는 여러 기술 블로그와 구성 견적 도구에서 일치하지만, Moonshot의 공식 발표 값은 아닙니다.
이후의 논의에서는 자릿수(Order of magnitude)의 기준으로 취급해 주십시오.
한편, 계층 ③의 상품 단가는 주당 $50에서 월 $300였습니다.
가령 월 $300의 상위 상품만으로 고정비 $25,000를 회수하려면, 상시 84명의 유료 결제자가 필요합니다.
실제로는 저가형이 주력이므로, 필요한 모수는 훨씬 더 많아집니다.
게다가 범죄자 측은 이 투자에 상응하지 않는 리스크를 짊어지게 됩니다.
대규모 GPU 조달과 결제는 Telegram 봇을 세우는 것에 비해 차원이 다르게 추적 가능한 흔적을 남깁니다.
이 시장의 브랜드는 단기적인 리브랜딩(Rebranding)의 연속이며, 몇 달 만에 사라지는 사업에 월 수만 달러의 고정비를 책정할 수는 없습니다.
애초에 피싱 메일 문장을 작성하는 데 2.8조 파라미터(Parameter)는 필요하지 않습니다.
Trend Micro는 2026년 2월 보고서에서 이 구조를 "'총'보다는 '총알'"이라고 표현했습니다6. (확도 중. 본문은 직접 취득할 수 없어 공개된 요약과 관련 기사를 통해 확인했습니다)
범죄 그룹은 자체적인 프런티어 모델(Frontier Model, 총)을 갖지 않고, 프롬프트, 래퍼, 도난당한 API 키(총알)를 팔고 있다는 정리입니다.
원가에 의한 설명이 옳다면, 모델 규모에 따라 "어디까지가 호스트되고 있는가"의 경계가 보여야 합니다.
실제로 횡단하며 조사해 보니 경계가 있었습니다.
| 모델 | 규모 | abliterated 버전 | API 호스트 |
|---|---|---|---|
| Kimi K3 | 2.8T | 있음 (2개 계통) | 없음 |
| ... |
그레이(Grey) 사업자가 호스트하고 있는 상한선은 대략 35B급입니다.
이를 초과하는 규모의 abliterated 버전은 만들어져 있기는 하지만, 아무도 API화하지 않았습니다.
K3만의 특수한 사정이 아니라, 일관된 구조였습니다.
이를 뒤집어 보면, 이것은 안심할 수 있는 요소가 아닙니다.
위험도와 입수 용이성은 역상관 관계가 아니기 때문입니다.
피싱 문구 작성에는 2.8조 파라미터가 필요 없으며, 월 수십 달러로 이용 가능한 8B~35B 규모의 무검열 모델로도 충분하기 때문입니다.
"프런티어 모델이 암시장으로 흘러 들어간다"라는 시나리오는 실질적인 피해의 소재를 잘못 짚고 있습니다.
그리고 이 천장의 위치를 결정하는 것은 규제나 양심이 아니라, GPU의 비용입니다.
양자화 (Quantization) 기술의 진보, MoE (Mixture of Experts, 입력마다 일부 전문가 서브 네트워크만을 작동시키는 방식)의 활성 파라미터 (Active Parameters)의 추가적인 축소, GPU 렌탈 비용의 저렴화 중 어느 하나라도 진행된다면 천장은 높아질 것입니다.
실제로 양산처 중 한 곳은 284B급 모델을 3.81GB까지 양자화한 버전을 이미 배포하고 있습니다.
'호스팅되지 않는다'와 '구동할 수 없다'는 별개의 문제입니다.
로컬에서 구동하기 위한 문턱은 이미 바닥까지 낮아져 있습니다.
여기서부터가 이번 조사에서 가장 걸렸던 부분입니다.
계층 ②의 사업자는 책임 구조에 따라 성격이 다른 네 가지 유형으로 나뉩니다.
무검열을 전문으로 하는 유형은 abliteration.ai 나 Venice AI가 이에 해당합니다.
무검열 모델마다 상품 페이지를 가지고 있으며, API 형태로 판매하고 있습니다.
abliteration.ai의 문구는, "uncensored does not mean ungoverned" (무검열이라고 해서 통제가 없는 것은 아니다)로 시작하며, 프로바이더 측의 거부 계층은 낮추되 정책 판단은 이용자의 애플리케이션이 수행한다고 이어집니다.
책임의 소재를 약관을 통해 이용자에게 넘기는 구조입니다.
대량 배포 유형이 구조적으로는 가장 강력한 영향력을 미치고 있습니다.
Featherless.ai는 모델 검색의 필터링 조건으로 학습 방법을 지정할 수 있으며, abliterated가 그 선택지 중 하나로 되어 있습니다.
조사 시점에서 862건이 해당되었으며, OpenAI 호환 API로서 정액제 플랜의 대상으로 나란히 나열되어 있었습니다.
여기서 중요한 것은 건수가 아니라, abliteration이 사고나 허점이 아니라 상품 카테고리로 정규화(Normalization)되어 있다는 점입니다.
게다가 이 회사는 Hugging Face의 공식 Inference Provider입니다.
즉, 모델 페이지에서 무검열 버전을 직접 API로 호출하는 경로가 플랫폼의 공식 기능으로서 열려 있습니다.
이 회사는 프롬프트와 생성 결과 모두 일절 로그를 남기지 않는다고 명시하고 있으며, abliterated 목록 페이지에는 경고나 연령 확인 게시가 없고 본인 확인에 대한 기재도 없습니다. (확도 중~고)
**애그리게이터 (Aggregator)**는 OpenRouter가 대표적이며, 무검열 모델에 대한 무료 티어를 포함한 라우팅을 제공합니다.
실행은 하류의 프로바이더가 담당하므로 책임은 더욱 분산됩니다.
반입형은 Novita, RunPod, DeepInfra와 같은 GPU 인프라 사업자들입니다.
이용자가 임의의 모델을 가져와 올리는 형태이므로 사업자는 아무것도 제공하지 않습니다.
약관 위반 여부를 판단하는 것조차 어려워집니다.
이 계층에 대해서는 특정 abliterated 모델을 위한 배포 설정 세트가 GitHub에서 배포되고 있는 사례까지 발견되었습니다.
절차는 이미 턴키 (Turnkey) 방식으로 준비되어 있습니다.
네 가지를 나열해 보면 경로가 보입니다.
누군가가 abliterated 버전을 Hugging Face에 올리면, 대량 배포 사업자가 그것을 가져와 즉시 API화합니다.
이 흐름은 자동화되어 있으며, 범죄 인프라는 전혀 필요하지 않습니다.
그리고 이 계층은 아마도 합법일 것입니다.
법인 대상의 형식을 갖추고 있으며, 감사 로그(Audit Log)나 정책 게이트웨이(Policy Gateway)와 같은 거버넌스 용어를 갖추고 있고, 약관상으로도 나름의 논리가 통합니다.
그렇기 때문에 규제도 적발도 닿기 어렵습니다.
'다크웹의 암시장'을 찾아다니다 보면, 가장 강력하게 작동하고 있는 이 계층을 통째로 놓치게 됩니다.
독자에게 가장 실용적인 결론을 말씀드리겠습니다.
일본어로 거부 반응이 잘 나타나지 않도록 명시적으로 조정된 abliterated 모델이 이미 공개되어 있습니다.
모델 카드에 그렇게 적혀 있습니다.
이는 일본어권에서 오랫동안 공유되어 온 방범 판단 기준이 효력을 상실했음을 의미합니다.
지금까지는 일본어가 부자연스럽거나, 경어가 이상하거나, 문장 부호 사용이 어색하다는 등의 단서로 사기 메일을 구별할 수 있었습니다.
그 단서를 제공했던 것은 공격자가 일본어 네이티브가 아니라는 사실이었습니다.
무검열 모델이 일본어의 거부 억제까지 조정되어 있는 이상, 이 전제는 더 이상 성립하지 않습니다.
문장의 질은 더 이상 공격자의 언어 능력을 반영하지 않게 되었습니다.
Rapid7의 제언도 같은 방향을 향하고 있습니다.
탐지의 축을 문장의 질에서 행동, 발신자 검증, 프로세스의 이상으로 옮기는 것입니다.
-
문장의 자연스러움으로 판단하지 않습니다. 발신처, 경로, 요청 내용의 타당성으로 판단합니다.
-
금전이나 인증 정보가 관련된 요청은 반드시 별도의 경로로 확인합니다. 이메일 답장으로 확인하는 것은 의미가 없습니다.
-
음성이나 비디오 통화도 위장의 대상입니다. 딥페이크 (Deepfake)로 임원을 사칭하여 2,500만 달러를 송금하게 만든 사례가 보고되었습니다.
-
AI 계정, API 키, 프롬프트 (Prompt), 업로드한 파일, 외부 서비스 연동을 클라우드 인증 정보와 동일한 등급으로 취급합니다. 최소 권한, 로그 (Log), 모니터링, 보존 규칙, 정기적인 자산 실사가 필요합니다. 계층 ④의 피해 규모는 여기서 결정됩니다.
-
이메일, 스토리지 (Storage), 코드 저장소 (Code Repository), 데이터베이스 (Database), 회계 시스템에 연결된 AI 연동 현황을 파악하고 리스크 순위를 매깁니다.
-
송금, 권한 변경, 임원 명의의 요청과 같은 고위험 업무에 승인 통제, 직무 분리, 대역 외 (Out-of-band) 확인 절차를 추가합니다.
-
사고 대응 계획에 「AI 계정 탈취」, 「프롬프트 유출」, 「API 키 침해」를 항목으로 추가합니다.
이 분야는 벤더들의 블로그 기사들이 출처 명시 없이 서로 같은 수치를 인용하며 순환 참조하고 있는 상태입니다.
조사 중에 눈에 띈 점 네 가지를 꼽겠습니다.
「악성 LLM은 212종류」를 현재 수치로 작성하지 말 것.
이 숫자의 출처는 인디애나 대학교 블루밍턴 교의 Malla 논문 (USENIX Security '24)으로, 2023년부터 2024년 시점의 스냅샷입니다7.
2026년의 현황이 아닙니다.
많은 기사가 「현재 212종류가 존재한다」며 현재형으로 재인용하고 있습니다.
참고로, 이 논문의 가치는 숫자뿐만이 아닙니다.
212개 서비스의 이면에 사용된 백엔드 (Backend) 모델이 8개뿐이었다는 점, 공개 LLM API의 보호를 회피하는 프롬프트를 182건 특정했다는 점이 더 중요하며, 「브랜드는 많지만 알맹이는 소수의 재사용」이라는 구조를 2024년 시점에 입증했습니다.
WormGPT를 하나의 연속된 존재로 작성하지 말 것.
2023년 6월에 공개된 오리지널은 보도와 연구자들의 주목을 받은 뒤 같은 해 8월에 제작자 본인에 의해 폐쇄되었습니다.
그 이후의 「WormGPT v4」 등은 브랜드명만 계승한 별개의 것으로, Rapid7은 코드 중복이 제로이며 실체는 Grok이나 Mixtral의 래퍼 (Wrapper)라고 밝히고 있습니다. (확도 높음)
「독자적인 파운데이션 모델을 자사 서버에서 운용」이라는 광고 문구를 그대로 믿지 말 것.
이는 판매자 본인의 주장이며, 독립적인 검증은 제한적입니다. (확도 중간)
1차 자료에 가까운 자료를 인용할 것.
이번 조사에서 신뢰할 수 있었던 것은 Rapid7 (2026-06-11), 트렌드 마이크로 (2026-02-09), Malla 논문, Kaspersky의 프레스 세미나 (2024-12-06) 네 가지였습니다.
찾고 있던 「다크웹에서 프론티어급 무검열 모델을 파는 업자」는 없었습니다.
이유는 원가 때문인데, 월 $25,000의 GPU 비용과 월 $300의 상품 단가가 맞지 않기 때문입니다.
그리고 이것은 기술적인 방파제가 아니라, 양자화 (Quantization)와 GPU 가격의 함수입니다.
조건이 바뀌면 이 균형은 무너집니다.
실제로 효과를 발휘하고 있는 것은 두 가지 계층이었습니다.
하나는 노트북에서도 구동되는 소형 무검열 모델입니다.
공격에 필요한 능력은 이미 훨씬 낮은 계층에서 무료且 무제한으로 구할 수 있습니다.
다른 하나는 기업용의 얼굴을 하고 클리어 웹 (Clear Web)에 존재하며, 무검열 모델을 상품 카테고리로 취급하는 사업자입니다.
그리고 일본어권 독자들에게는 일본어의 부자연스러움이라는 단서가 사라진 것이 가장 구체적인 변화입니다.
탐지의 축을 문장의 질에서 프로세스와 경로의 타당성으로 옮길 수밖에 없습니다.
- Jeremy Makowski (Rapid7 Threat Research), "Criminal AI-as-a-Service in 2026: How the Underground Market Is Operationalizing Cybercrime", 2026-06-11
- 트렌드마이크로 「AI 범죄의 실태와 미래 전망: '총'보다 '탄약' 판매에 나서는 범죄 그룹」 2026-02-09
- Zilong Lin, Jian Cui, Xiaojing Liao, XiaoFeng Wang (Indiana University Bloomington), "Malla: Demystifying Real-world Large Language Model Integrated Malicious Services", USENIX Security '24, arXiv:2401.03315
- Andy Arditi et al., "Refusal in Language Models Is Mediated by a Single Direction", NeurIPS 2024, arXiv:2406.11717
- "There Is More to Refusal in Large Language Models than a Single Direction", 2026, arXiv:2602.02132
- Moonshot AI, "Kimi K3 Tech Blog: Open Frontier Intelligence", 2026-07-17
- ITmedia 엔터프라이즈 「ChatGPT는 범죄자들의 '좋은 동반자'에 다크웹에서 관측한 생성형 AI의 오용 사례 8선」 2024-12-17 (Kaspersky / Vladimir Kamluk 의 프레스 세미나)
- Hugging Face 상의 모델 카드 (Uniboshi/Kimi-K3-Abliterated-V1, audnai/penclaw-Kimi-K3.0-abliterated-GGUF), 및 각 사업자의 공개 페이지 (2026년 8월 2일 기준 표시 내용)
조사는 공개 정보만을 바탕으로 진행되었으며, 다크웹 내부의 직접 관측이나 실제 서비스에 대한 접촉 또는 구매는 이루어지지 않았습니다.
Andy Arditi et al., "Refusal in Language Models Is Mediated by a Single Direction", NeurIPS 2024. arXiv:2406.11717. 구현은 refusal_direction으로 공개되어 있습니다. ←
ablation(제거 실험)과 obliterate(지워버리다)를 조합한 신조어입니다. 학술 용어라기보다는 커뮤니티에서 통용되는 별칭에 가깝습니다. ←
Jeremy Makowski (Rapid7 Threat Research), "Criminal AI-as-a-Service in 2026: How the Underground Market Is Operationalizing Cybercrime", 2026-06-11. rapid7.com ←
ITmedia 엔터프라이즈 「ChatGPT는 범죄자들의 '좋은 동반자'에 다크웹에서 관측한 생성형 AI의 오용 사례 8선」 2024-12-17 (Kaspersky 의 프레스 세미나, 2024-12-06 내용). itmedia.co.jp ←
트렌드마이크로 「AI 범죄의 실태와 미래 전망: '총'보다 '탄약' 판매에 나서는 범죄 그룹」 2026-02-09. trendmicro.com ←
Zilong Lin et al., "Malla: Demystifying Real-world Large Language Model Integrated Malicious Services", USENIX Security '24. arXiv:2401.03315 ←
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기