
Certified Offensive AI Expert (COAE) 합격 수기
요약
HackTheBox의 AI 보안 인증 자격인 Certified Offensive AI Expert (COAE) 합격 수기입니다. 적대적 머신러닝, 프롬프트 인젝션, AI 시스템 보안 등 AI 레드팀 역량을 평가하는 시험의 내용과 학습 방법을 공유합니다.
핵심 포인트
- COAE는 Google과 공동 개발한 실전적인 AI 보안 인증 자격임
- 적대적 머신러닝, LLM 공격 및 방어 등 광범위한 AI 보안 기술을 다룸
- AI Red Teamer 패스 모듈 반복 학습과 공격/방어 기법 정리가 핵심
- AI 기술 지식 외에도 기본적인 침투 테스트 지식이 요구됨
개요
안녕하세요, 컴퓨터와 프로그래밍을 좋아해서 취미로 공부하고 있는 wfox5입니다. 이번에는 HackTheBox 인증 시험인 Certified Offensive AI Expert (COAE)에 합격했기에, 그 합격 수기를 작성해 보고자 합니다. 일본어로 된 합격 수기가 풍부하지 않았기에, 참고가 된다면 기쁘겠습니다.
Certified Offensive AI Expert (COAE)에 대하여
공식 페이지를 번역하면 다음과 같이 기재되어 있습니다.
HTB COAE는 AI 및 머신러닝 (Machine Learning) 시스템의 취약점을 식별하고 악용하기 위해, Google과 공동 개발한 커리큘럼으로 습득한 지식을 평가하는 실전적인 인증 자격입니다. 자격 취득자는 적대적 머신러닝 (Adversarial Machine Learning) (회피 공격 (Evasion Attack), 데이터 포이즈닝 (Data Poisoning)), LLM 프롬프트 인젝션 (Prompt Injection) 및 탈옥 (Jailbreak), LLM 출력 악용 (XSS, SQL 인젝션, 코드 인젝션), AI 애플리케이션 및 시스템 보안 (MCP 취약점, 배포 변조, 모델 리버스 엔지니어링 (Model Reverse Engineering)), AI 방어 (가드레일 (Guardrails), 적대적 훈련 및 튜닝 (Adversarial Training and Tuning)), AI 프라이버시 (멤버십 추론 (Membership Inference), 차분 프라이버시 (Differential Privacy))에 관한 기술적 능력을 증명합니다. 커리큘럼은 Google의 Secure AI Framework (SAIF), OWASP Machine Learning Security Top 10, OWASP Top 10 for Agentic Applications, OWASP Top 10 for LLM Applications 2025를 준수합니다. 자격 취득자는 전문적인 AI 레드팀 (Red Team) 평가를 실시하고, 그 결과를 효과적으로 전달할 수도 있습니다.
응시 당시의 스펙
- HackTheBox Grandmaster
- TryHackMe GUARDIAN
- 응용정보
- 기본정보
- 보안 매니지먼트
- IT 패스포트
대학에서 이미지 계열의 딥러닝 (Deep Learning) 연구를 했었지만, Kaggle은 Titanic 정도밖에 해보지 않아서, 머신러닝·딥러닝의 기초를 한 차례 훑은 정도의 레벨입니다.
시험 포털 사이트 등에서도 언급되고 있지만, 85점 이상의 점수와 상용 수준의 리포트가 요구됩니다.
난이도에 대하여
- 바우처 1개로 2회 응시 가능
- 1회차와 2회차는 동일한 시험 환경
저는 1회차 응시 때 45점이었고, 재응시 3일째에 100점 만점까지 도달했습니다.
처음 접했을 때 가차 없다는 생각에 당황했지만, 침착하게 꼼꼼히 열거해 나가니 조금씩 플래그 (Flag)를 획득할 수 있었습니다.
학습 방법에 대하여
AI Red teamer 패스의 모듈을 2회 반복했습니다. 1회차를 마친 후 시간이 꽤 지났기 때문에 연습 문제를 중심으로 2회차까지 진행했습니다. 시험에서는 모듈의 내용이 골고루 출제되므로, 모듈에서 나온 공격 기법이나 방어 기법은 노트북에 정리해 두면 시험 시 시간을 단축하는 데 도움이 될 것이라고 생각합니다. 또한, COAE 시험은 AI 기술의 공격 기법과 방어 기법뿐만 아니라, 기본적인 침투 테스트 (Penetration Test) 공격 지식도 일부 요구되므로, 가능하다면 HackTheBox lab 공부도 병행한다면 합격에 더 가까워질 수 있을 것 같습니다.
모듈 전체에 대한 감상
AI/ML의 개념 및 Python을 이용한 기초적인 모델 개발부터 시작하여, 프롬프트 인젝션, LLM 출력 악용, 데이터 포이즈닝, 애플리케이션 계층 및 시스템 계층 공격, MCP 서버 공격, 적대적 수학을 이용한 AI 모델에 대한 회피 기법 및 그에 대한 방어 기법에 대해 배울 수 있었습니다. 연간 플랜으로 구매했을 경우에는 연습 문제의 힌트를 얻을 수 있다고 하는데, 저는 큐브 (Cube)로 구매했기 때문에 죽을 힘을 다해 했습니다 (학생분들은 월액 학생 플랜이라는 것도 있는 것 같습니다).
시험에 대하여
1회차 응시
1일차 ・・・ 플래그 0
2일차 ・・・ 플래그 0
3일차 ・・・ 플래그 2개 (30점)
4일차 ・・・ 플래그 0
5일차 ・・・ 플래그 0
6일차 ・・・ 플래그 1개 (45점)
7일차 ・・・ 리포트 작성 및 제출
재응시
1일차 ・・・ 플래그 0
2일차 ・・・ 플래그 3개 (85점)
3일차 ・・・ 플래그 1개 (100점)
4일차 ・・・ 리포트 작성
5일차 ・・・ 리포트 작성
6일차 ・・・ 리포트 제출
재응시에서 100점 만점에 도달하고 리포트를 제출한 후, 영업일 기준 12일 뒤에 합격 메일이 도착했습니다.

요약
AI 모델의 공격 기법과 방어 기법을 실전적으로 배울 수 있어서 좋았다.
다음에는 웹 보안 (Web Security)을 배울 수 있는 CWES 시험에 도전하고 싶다.
AI 보안에 관심 있는 사람에게 매우 추천한다.
추천 도서 (관심 있는 분들을 위해)
・scikit-learn을 사용한 머신러닝 (Machine Learning) 학습 가능
・딥러닝 (Deep Learning)에 대해 학습 가능
・자연어 처리 (NLP)에 대해 학습 가능
・NumPy, pandas, Matplotlib에 대해 학습 가능
・특징량 엔지니어링 (Feature Engineering)에 대해 학습 가능
・머신러닝 모델에 대한 방어 기법 (Defense Methods) 학습 가능
・pytorch에 대해 학습 가능
・LLM에 대해 학습 가능
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기