Show HN: 취약점이 공개되는 AI 에이전트 레드팀 테스트용 오픈소스 플레이그라운드
요약
Fabraix Playground는 AI 에이전트의 취약점을 테스트하고 보안 가드레일을 강화하기 위한 오픈소스 레드팀 테스트 플랫폼입니다. 실제 라이브 AI 에이전트를 대상으로 탈옥(jailbreak) 시나리오를 수행하며, 발견된 공격 기술과 시스템 프롬프트를 공개하여 커뮤니티가 함께 더 안전한 에이전트를 구축하도록 돕습니다.
핵심 포인트
- 실제 능력을 갖춘 라이브 AI 에이전트를 대상으로 하는 레드팀 테스트 환경 제공
- 시스템 프롬프트와 챌린지 설정을 투명하게 공개하여 집단 지성을 통한 보안 강화 도모
- 커뮤니티 제안 및 투표를 통해 새로운 테스트 시나리오를 지속적으로 업데이트
- 성공적인 공격 기술과 추론 과정을 문서화하여 방어 체계 구축을 위한 학습 자료로 활용
Fabraix Playground
AI 에이전트 (AI agents)는 우리가 일하는 방식을 재편하고 있습니다. 인간의 창의성을 필요로 하지 않으면서 인간의 시간을 소비했던 반복적이고 기계적인 작업들은, 정확히 그러한 목적을 위해 설계된 시스템들에 의해 점점 더 많이 처리되고 있습니다. 남겨진 것은 가장 중요한 작업들, 즉 인간만이 가져올 수 있는 사고, 판단, 그리고 창의적인 도약입니다. 우리는 이것이 소프트웨어가 구축되고 사용되는 방식에 있어 가장 흥미로운 변화 중 하나라고 생각하며, 이는 단지 시작일 뿐입니다.
이 모든 것을 가능하게 하는 궁극적인 동력은 신뢰 (trust)입니다. 사람들이 에이전트에게 실제 작업을 맡기고, 에이전트가 해야 할 일은 수행하되 하지 말아야 할 일은 하지 않을 것이라고 확신할 수 있기 전까지는 그 어떤 것도 확장될 수 없습니다. 그러한 신뢰는 폐쇄된 공간에서 단일 팀에 의해 구축될 수 없습니다. 연구자, 엔지니어, 그리고 진정으로 호기심 많은 이들이 모인 커뮤니티가 동일한 시스템을 압박 테스트 (pressure-testing)하고 발견한 것을 공유함으로써, 공개된 장소에서 집단적으로 획득해야 합니다.
Playground는 그러한 노력을 실체화하기 위해 존재합니다. 모든 챌린지 (challenge)는 장난감 같은 시나리오나 모의 문서 파서 (mocked-up document parser)가 아니라, 실제 능력을 갖춘 라이브 AI 에이전트를 배포하며, 커뮤니티가 이를 무너뜨릴 수 있도록 개방합니다. 시스템 프롬프트 (System prompts)는 공개됩니다. 챌린지 설정 (Challenge configs)은 공개적으로 버전 관리됩니다. 누군가 돌파구를 찾아내면, 승리한 기술은 모두가 배울 수 있도록 문서화됩니다. 이렇게 공개된 지식은 더 나은 방어 체계를 강제하고, 이는 더 어려운 챌린지로 이어지며, 결과적으로 더 깊은 이해를 만들어냅니다.
작동 방식
각 챌린지는 특정 페르소나 (persona), 일련의 도구 (웹 검색, 브라우징 등), 그리고 보호하도록 지시받은 무언가를 가진 라이브 AI 에이전트를 당신 앞에 제시합니다. 시스템 프롬프트 (System prompt)는 완전히 공개되어 있습니다. 당신의 임무는 그럼에도 불구하고 가드레일 (guardrails)을 통과할 방법을 찾는 것입니다.
커뮤니티가 무엇을 테스트할지 결정합니다:
- 누구나 챌린지를 제안 (proposes a challenge)합니다 — 시나리오, 에이전트 (agent), 목표를 포함합니다.
- 커뮤니티가 투표합니다.
- 가장 많은 표를 얻은 챌린지가 제한 시간 (ticking clock)과 함께 라이브 서비스 적용을 검토합니다.
- 가장 빠르게 탈옥 (jailbreak)에 성공한 사람이 승리합니다.
- 승리한 기술이 공개됩니다 — 접근 방식, 추론 과정, 모든 것을 포함합니다.
마지막 단계가 가장 중요합니다. 우리가 공개하는 모든 기술은 AI 에이전트 (AI agents)가 어떻게 실패하는지, 그리고 실패하지 않는 에이전트를 어떻게 구축할 수 있는지에 대해 커뮤니티가 집단적으로 이해하는 바를 진전시킵니다.
프로젝트 구조 (Project structure)
/src— React 프론트엔드 (TypeScript, Vite, Tailwind)/challenges— 모든 챌린지 설정 및 시스템 프롬프트 (system prompt), 버전 관리 및 공개
가드레일 (Guardrail) 평가는 클라이언트 측 변조 (client-side tampering)를 방지하기 위해 서버 측 (server-side)에서 실행됩니다. 에이전트 런타임 (agent runtime)은 별도로 오픈 소스화될 예정입니다.
로컬에서 실행하기 (Run locally)
npm install
npm run dev
기본적으로 라이브 API에 연결됩니다. 로컬 백엔드 (local backend)를 대상으로 개발하려면 다음과 같이 실행하세요:
VITE_API_URL=http://localhost:8000/v1 npm run dev
참여하기 (Get involved)
- 챌린지 제안하기 (Propose a challenge) — 커뮤니티가 도전할 다음 시나리오를 설계하세요
- 에이전트 기능 제안하기 (Suggest agent capabilities) — 새로운 도구 (tools), 행동 (behaviors) 또는 워크플로우 (workflows)
- 버그 보고하기 (Report bugs) — 무언가 작동하지 않을 경우
- Discord — 기술을 논의하고 접근 방식을 공유하세요
Fabraix 소개 (About Fabraix)
우리는 Fabraix에서 AI 에이전트 (AI agents)를 위한 런타임 보안 (runtime security)을 구축합니다. 이 플레이그라운드 (Playground)는 우리가 공개적으로 방어 체계를 스트레스 테스트 (stress-test)하는 방법이며, 더 넓은 커뮤니티가 AI 보안 및 실패 모드 (failure modes)에 대한 공동의 이해에 기여하는 방식입니다. 더 많은 사람이 이러한 시스템을 조사할수록, AI로 무언가를 만드는 모든 사람에게 더 나은 결과가 돌아갑니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기