
GPT-Red가 다른 GPT를 공격합니다: 왜 0.05%가 여전히 안전을 보장하지 않는가
요약
OpenAI가 공개한 GPT-Red는 다른 모델을 공격하고 적대적 데이터를 생성하는 자동화된 레드팀 모델입니다. 특정 벤치마크의 낮은 실패율이 실제 에이전트 환경의 보안을 보장하지 않으므로 주의가 필요합니다.
핵심 포인트
- GPT-Red는 자동화된 프롬프트 인젝션 공격을 통해 취약점을 탐색함
- 벤치마크의 공격 성공률과 실제 에이전트의 보안 수준은 별개임
- 에이전트의 권한과 외부 도구 접근성이 보안 위험의 핵심 요소임
- 수동 레드팀의 한계를 극복하기 위한 자동화된 공격 모델의 등장
7월 15일, OpenAI는 내부용 GPT-Red를 공개했습니다. 이는 다른 모델을 반복적으로 공격하고, 해당 모델들의 학습을 위한 적대적 데이터 (adversarial data)를 생성하는 모델입니다. 도구(tools)를 사용하는 에이전트에 GPT를 도입하는 팀들에게 여기서의 핵심 결론은 "AI가 AI를 해킹한다"는 화려한 그림이 아닙니다. GPT-Red의 직접 공격 (direct attacks)에서 나타난 0.05%의 실패율 (failures)은 특정 테스트에 국한된 것이지, 귀하의 에이전트가 안전하게 작동할 확률을 의미하는 것이 아니라는 점입니다.
그럼에도 이는 중요한 변화입니다. 수동적인 레드팀 (red team)은 전문가의 시간과 시나리오의 수에 제한을 받습니다. 반면 자동화된 공격자는 일련의 프롬프트 인젝션 (prompt injection) 시퀀스를 통해 다양한 변형을 탐색할 수 있으며, 발견된 취약점을 방어자의 학습 과정에 다시 반영할 수 있습니다. OpenAI의 보고에 따르면, 간접 프롬프트 인젝션 (indirect prompt injection)을 위한 내부 복제 아레나 (arena) 테스트에서 GPT-Red는 인간의 13% 성공률에 비해 84%의 시나리오를 성공적으로 통과했습니다.
하지만 바로 이 지점에서 잘못된 전이를 범하기 쉽습니다. 특정 테스트 환경에서 공격자의 높은 성과가 귀하의 시스템이 가진 입력값, 권한 및 결과에 대해 무엇을 말해주는 것은 아닙니다.
서로 다른 질문에 답하는 세 가지 숫자
OpenAI는 몇 가지 결과를 제시하고 있으며, 이를 하나의 통합된 보안 백분율로 합산해서는 안 됩니다.
- 84% 대 13%는 간접 프롬프트 인젝션 (indirect prompt injection)에 대한 자체 복제 아레나 (arena)에서의 공격 성공률을 설명합니다.
- GPT-5.6 Sol에 대해 회사는 가장 까다로운 직접 벤치마크 (direct benchmark)에서 실패율 (failures)이 6배 더 낮다고 주장합니다.
- 0.05%라는 수치는 정확히 직접 GPT-Red 공격 (direct GPT-Red attacks) 시의 실패율 (failures)에 해당합니다.
이 수치 중 그 어느 것도 이메일을 읽고, 페이지 내용을 가져오며, 외부 서비스를 호출하고 데이터에 접근 권한을 가진 에이전트를 자동으로 측정하지 않습니다. 모델이 본 텍스트와 시스템이 수행한 행동 사이에는 여전히 전체적인 의사결정 루프가 존재합니다.

왜 벤치마크 (benchmark)가 귀하의 에이전트 하네스 (agent harness)와 같지 않은가
벤치마크 (benchmark)는 게임의 규칙을 설정합니다. 즉, 공격자가 어떤 지시를 받는지, 방어자에게 어떤 행동이 허용되는지, 그리고 실패 (failure)가 어떻게 기록되는지를 결정합니다. 실제 에이전트 (agent) 환경에서는 팀과 인프라가 이러한 규칙을 결정합니다.
만약 도구 (tool)에 데이터를 외부로 전송할 수 있는 권한이 있다면, 위험성은 모델이 유해한 지시를 인식했는지 여부에만 달려 있지 않습니다. 도구의 구체적인 권한, 환경 격리 (isolation), 허용된 방향의 화이트리스트 (allowlist), 되돌릴 수 없는 작업에 대한 승인, 그리고 이벤트 로그 (event log)가 중요합니다. 훌륭한 모델은 위험한 결정의 수를 줄일 수는 있지만, 검증되지 않은 텍스트와 실제 행동 사이의 유일한 경계가 되어서는 안 됩니다.
OpenAI는 GPT-Red를 인간 (human) 및 제3자 레드팀 (third-party red teams), 모니터링 및 기타 방어 계층을 보완하는 수단으로 설명합니다. 이는 릴리스 끝에 붙는 조심스러운 면책 조항이 아니라, 실질적인 아키텍처적 입장입니다. 즉, 공격 모델은 취약점 탐색을 확장하지만, 실행 방어 (defense of execution)를 무효화하지는 않는다는 것입니다.
또한 회사는 10개의 지연된 작업 (delayed tasks)에서 자율형 벤딩 에이전트 (vending agent)와 Codex CLI의 사례를 제시합니다. 이는 실험실 환경에서 더 응용된 컨텍스트로의 전이 (transfer)를 확인하는 유용한 검증입니다. 그러나 10개의 작업과 두 가지 유형의 시스템은 여전히 사례 (cases)일 뿐, 모든 에이전트 하네스 (agent harness)에 적용되는 기본 확률은 아닙니다.
불쾌한 반전: 강력한 공격자가 귀하의 위협 모델 (threat model)을 대체하지는 않는다
처음에는 셀프 플레이 (self-play)가 보안에서 가장 비용이 많이 드는 부분을 해결해 주는 것처럼 보입니다. 즉, 한 모델은 24시간 내내 공격을 고안하고, 다른 모델은 이를 방어하는 법을 배우게 하는 것입니다. 그러나 이러한 접근 방식의 가치는 무엇을 공격하도록 허용되었는지, 그리고 성공이 어떻게 정의되었는지에 따라 제한됩니다.
과도한 낙관론에 대한 가장 강력한 반론은 타당합니다. 만약 테스트 루프 (test loop)에 이미 특정 위험 행동으로 이어지는 경로가 포함되어 있지 않다면, 낮은 실패율 (failure rate)은 해당 경로에 대한 탄력성 (resilience)을 증명하지 못합니다. 이는 GPT-Red에 반대하는 논거가 아닙니다. 단 한 번의 평가 결과를 근거로 에이전트에게 광범위한 권한을 부여하는 것을 경계해야 한다는 논거입니다.
도구가 없는 단순한 ChatGPT의 경우, 오류의 대가는 잘못된 답변이라는 수준에 그칠 수 있습니다. 하지만 기록을 변경하거나, 메시지를 전송하거나, 작업을 실행하는 에이전트(Agent)에게 동일한 오류는 운영상의 오류가 됩니다. 따라서 팀의 과제는 "마법 같은 백분율을 가진 모델을 찾는 것"이 아니라, 단 한 번의 실패로라도 허용될 수 없는 행동이 무엇인지 정의하는 것입니다.
권한 확장 전 최소 테스트
모델과 일반적인 대화를 나누는 대신, 도구(Tool)를 사용하는 실제 시나리오를 바탕으로 하나의 좁은 테스트를 수행하십시오.
- 에이전트가 실제로 수행해야 하는 외부 동작 하나를 선택합니다.
- 해당 동작을 위한 최소한의 권한만 부여하고, 실제 데이터 대신 테스트용 비밀 마커(Secret-marker)를 제공합니다.
- 에이전트의 목표를 변경하려는 시도가 포함된 검증되지 않은 콘텐츠를 입력합니다.
- 실패 기준(Failure criterion)을 사전에 정의합니다: 예컨대, 허용되지 않은 도구 호출, 테스트 마커 전송, 또는 필수 승인 절차 우회 등입니다.
- 로그(Log)를 확인합니다: 입력값, 결정 사항, 호출된 도구, 그리고 사람이 동작을 중단할 수 있었던 지점을 복구할 수 있는지 확인합니다.
이러한 테스트가 모든 미래 시나리오의 안전성을 증명하는 것은 아닙니다. 하지만 훨씬 더 유용한 질문에 답을 해줍니다: 권한이 확장되기 전에, 귀하의 실제 환경(Contour)이 특정 유형의 오류를 견뎌낼 수 있는가?
여러 모델을 비교하고 생성자(Generator)와 검증자(Checker)의 역할을 분리해야 할 때는 루블화 결제가 가능한 단일 API provod.ai를 통해 구성할 수 있습니다. 그러나 애그리게이터(Aggregator)가 샌드박스(Sandbox), 최소 권한 원칙(Least privilege), 허용 목록(Allowlist), 사람의 승인(Human confirmation), 그리고 감사 로그(Audit log)를 대체할 수는 없습니다. 애그리게이터는 실험을 조직하는 데 도움을 줄 뿐, 보안의 경계 자체를 옮겨주지는 않습니다.
GPT-Red의 결과를 무엇으로 간주해야 하는가
GPT-Red는 자동화된 레드 티밍 (red teaming)이 적대적 데이터 (adversarial data)를 탐색하고 생성하는 데 있어 점점 더 실용적으로 변하고 있다는 증거로 받아들여져야 합니다. 0.05%라는 수치는 에이전트 시스템 (agentic system)을 위한 보험 증권이라기보다는, 특정 직접 평가의 결과로서 유용합니다.
올바른 순서는 화려한 벤치마크 (benchmark)보다 훨씬 지루합니다. 먼저 결과의 영향을 제한하고, 그다음 테스트용 비밀 정보를 사용하여 시나리오를 검증하며, 실패 기준 (failure criterion)을 통과한 곳에만 권한을 확장해야 합니다. 그리고 나서야 모델이 귀하의 컨투어 (contour) 내부에서 어떻게 행동하는지를 바탕으로 모델들을 비교해야 합니다.

provod.ai — 공급업체가 아닌 작업에 맞춰 모델을 선택하세요
코드, 복잡한 추론 (reasoning), 검색, 긴 문서 및 미디어 생성은 서로 다른 도구를 필요로 합니다: API, 균형 및 팀의 인프라를 유지하면서 모델을 전환하십시오.
하나의 카탈로그에서 텍스트 및 미디어를 위한 최신 모델을 확인하세요: OpenAI의 GPT, Anthropic의 Claude, Google의 Gemini, xAI의 Grok, DeepSeek, Qwen, GLM, Kimi 및 MiniMax; 이미지를 위해서는 Nano Banana 2 Pro 및 GPT Image; 비디오를 위해서는 Seedance, Kling, Veo 및 Google Omni의 최신 버전이 준비되어 있습니다. 또한 추론 (reasoning), 검색, 문서, 임베딩 (embeddings), 음악 및 오디오를 위한 모델도 이용 가능합니다.
애그리게이터 (aggregator)의 숨겨진 추가 비용 없이 품질과 비용을 비교하세요: 가격은 제공업체의 공식 요율과 1:1로 동일하므로, 선택은 provod.ai의 불필요한 수수료가 아닌 작업에 의해 결정됩니다.
귀하의 시나리오에 맞는 모델을 선택하세요: 등록 양식 · 모델 가격 · 152-FZ에 따른 데이터 보호 · provod.ai 메인
첫 번째 에이전트 시나리오를 위해 무엇을 선택하시겠습니까: 속도를 위해 도구에 대한 폭넓은 접근 권한을 허용하시겠습니까, 아니면 필수적인 작업 확인 절차를 포함한 더 작은 컨투어를 선택하시겠습니까?
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기