오픈 웨이트 모델에 어떻게 백도어를 심는가에 대한 실증. 특히 이른바 무검열이라는 파인튜닝을 아무런 경계없이(무검열이라는 것때문에 보안
요약
본 기사는 오픈 웨이트 모델에 백도어를 심는 실증적인 방법을 다룹니다. 저자들은 50달러 미만의 비용으로 7B 오픈 모델에 백도어를 성공적으로 주입했으며, 특정 트리거 구문만으로 자격 증명을 탈취하는 것을 입증했습니다. 이는 보안 커뮤니티가 주목해야 할 심각한 문제입니다.
핵심 포인트
- 저비용(50달러 미만)으로 7B 오픈 모델에 백도어 주입이 가능함.
- 특정 트리거 구문 사용 시 자격 증명 탈취 성공률이 100%였음.
- 공격자는 연구소 직원 계정을 이용해 오염된 가중치를 공급망에 직접 투입할 수 있음.
오픈 웨이트 모델에 어떻게 백도어를 심는가에 대한 실증. 특히 이른바 무검열이라는 파인튜닝을 아무런 경계없이(무검열이라는 것때문에 보안 경계심은 더 낮아질 수 있으니) 받아들이다간 크게 당할 날이 올 것.
<어떻게 Abliterated 모델이 당신을 pwned 상태로 만들 수 있는가 👾
우리는 50달러 미만의 비용으로 7B 오픈 모델에 백도어를 심었고, Codex를 그쪽으로 겨누자 트리거 프레이즈를 사용한 순간 자격 증명을 조용히 훔쳐갔다. 성공률은 100%였으며, 일반 사용자 프롬프트에서 거짓 트리거는 전혀 없었다.
Abliterated 모델은 지금 보안 커뮤니티 전체에 퍼져 있다. 왜냐하면 프론티어 모델에 대한 사이버 승인 액세스를 얻는 것이 여전히 고통스러운 일이기 때문이다.
다음 블로그에서는 우리가 주요 AI 연구소 직원들로부터 유출된 Hugging Face 자격 증명을 어떻게 발견했는지 보여줄 것이다. 그래서 공격자는 자신의 이름으로 업로드할 필요조차 없다. 그들은 연구소 직원의 계정에서 백도어가 심긴 모델을 푸시하고, 오염된 가중치를 공급망에 직접 떨어뜨릴 수 있다.>
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: 한국 AI/LLM의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기