
Opus 5, 브라우저 에이전트에서 프롬프트 인젝션(Prompt Injection) 성공률 0% 달성
요약
Anthropic의 Opus 5가 Auto Mode를 통해 브라우저 에이전트 테스트에서 프롬프트 인젝션 성공률 0%를 달성했습니다. 이는 보안 문제를 해결 불가능하다고 본 OpenAI의 견해에 도전하는 결과입니다.
핵심 포인트
- Opus 5는 129개 테스트 시나리오에서 프롬프트 인젝션 0% 기록
- Auto Mode의 이중 방어 계층(데이터 스캔 및 실행 차단)이 핵심 역할 수행
- Auto Mode 미사용 시 Opus 5의 인젝션 성공률은 3.7%로 상승
- 기업용 AI 에이전트 배포 시 보안 신뢰성을 확보하는 중요한 지표
Auto Mode를 탑재한 Anthropic의 Opus 5는 129번의 테스트에서 프롬프트 인젝션 (Prompt Injection) 성공률 0%를 달성하며, 이 문제가 해결 불가능하다는 OpenAI의 견해에 도전했습니다.
Anthropic의 Opus 5는 129개의 브라우저 에이전트 테스트 시나리오에서 0%의 프롬프트 인젝션 (Prompt Injection) 성공률을 기록했습니다. 시스템 카드(System Card)에 상세히 기술된 이 결과는 프롬프트 인젝션 (Prompt Injection)이 결코 완전히 해결되지 않을 수도 있다는 OpenAI의 지난 12월 인정을 반박합니다.
주요 사실
- 129개의 브라우저 에이전트 테스트에서 0%의 프롬프트 인젝션 (Prompt Injection) 성공률 기록.
- Auto Mode는 보안을 위해 두 개의 방어 계층 (Defense Layers)을 쌓습니다.
- Auto Mode가 없을 경우, Opus 5의 성공률은 3.7%입니다.
- Sonnet 5는 Auto Mode 없이 0.93%를 달성합니다.
- Gray Swan 테스트: 성공률이 5.5%에서 2.0%로 하락했습니다.
공격자가 웹페이지 텍스트에 명령어를 숨겨 AI 에이전트를 하이재킹 (Hijack)하는 프롬프트 인젝션 (Prompt Injection)은 브라우저 기반 AI 에이전트의 아킬레스건이었습니다. Anthropic은 Claude Cowork와 같은 제품의 Auto Mode 기능과 결합된 자사의 Opus 5 모델이 이제 테스트에서 이러한 공격을 완전히 차단한다고 주장합니다. The Decoder에 따르면, 129개의 테스트 시나리오 전반에서 공격 성공률이 0%에 도달했습니다. 이는 프롬프트 인젝션 (Prompt Injection)이 결코 완전히 해결되지 않을 수도 있다고 인정한 OpenAI의 입장과 극명한 대조를 이룹니다.
Auto Mode가 0%를 달성하는 방법
0%의 성공률은 Auto Mode가 활성화된 상태에서만 유지됩니다. Auto Mode는 두 개의 방어 계층 (Defense Layers)을 쌓습니다. 하나는 모델이 데이터를 처리하기 전에 들어오는 데이터에서 숨겨진 명령어를 스캔합니다. 다른 하나는 실행 전에 위험한 동작을 차단합니다. 공격자는 이 두 가지를 각각 독립적으로 돌파해야 합니다. Auto Mode가 없다면 Opus 5의 성공률은 3.7%로 상승합니다. 흥미롭게도 Sonnet 5는 Auto Mode 없이 0.93%를 기록하며 더 나은 성능을 보여주는데, 이는 모델 아키텍처 (Architecture) 자체가 견고함에 기여함을 시사합니다. 보안 기업 Gray Swan의 일반적인 프롬프트 인젝션 (Prompt Injection) 테스트에서, 15회 시도 후 성공률은 5.5%(Opus 4.8)에서 2.0%로 떨어졌습니다.
경쟁 환경 (The Competitive Landscape)
OpenAI는 아직 자사 모델에 대해 이와 비교할 만한 보안 벤치마크 (Security Benchmark)를 공개하지 않았습니다. 그 대비는 극명합니다. Anthropic은 상세한 시스템 카드 (System Card) 수치를 공개하고 있는 반면, OpenAI의 인정은 그들이 이 문제를 해결 불가능한 것으로 보고 있음을 시사합니다. 양식을 작성하거나 내부 도구에 접근하는 것과 같이 민감한 브라우저 작업을 처리하기 위해 AI 에이전트 (AI Agents)를 배포하는 기업 고객들에게 이는 결정적인 요소가 될 수 있습니다. Anthropic의 터미널 네이티브 코딩 에이전트인 Claude Code는 이미 SWE-bench Verified에서 88.6%의 점수를 기록하고 있습니다. 여기에 프롬프트 인젝션 (Prompt Injection) 면역력을 더하는 것은 기업 대상의 소구점 (Enterprise Pitch)을 강화합니다.
주의 사항 및 미결 질문 (Caveats and Open Questions)
129개의 테스트 시나리오는 모든 경우를 포괄하지는 않습니다. 실제 공격은 다뤄지지 않은 엣지 케이스 (Edge Cases)를 악용할 수 있습니다. 시스템 카드는 테스트된 공격 유형의 다양성을 공개하지 않습니다. 또한, 0%의 성공률은 지연 시간 (Latency)을 증가시키는 Auto Mode에 의존하므로, 보안과 속도 사이의 트레이드오프 (Trade-off)는 아직 정량화되지 않은 상태로 남아 있습니다. Anthropic은 또한 최근 MCP에서의 STDIO 명령 인젝션 (Command Injection)과 관련된 CVE-2026-30623 문제에 직면해 있으며, 이는 강력한 모델이라 할지라도 다른 곳에서는 보안 격차가 존재할 수 있음을 보여줍니다.
관전 포인트 (What to watch)
Opus 5의 프롬프트 인젝션 방어에 대한 독립적인 레드팀 (Red-team) 평가, 특히 Gray Swan이나 Trail of Bits와 같은 기업들의 평가를 주목하십시오. 또한 OpenAI가 차기 모델에 대해 유사한 벤치마크를 출시하는지, 그리고 그 결과로 Claude Cowork의 기업 도입이 가속화되는지도 모니터링해야 합니다.
출처: the-decoder.com
원문 게시: gentic.news
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기