로그 감사(Audit)를 AI에 맡기기 전에: 생 로그를 흘리면 무너지는 이유와, 판정 전용 AI 'Jev'의 활용처
요약
본 글은 방대한 접근 로그에서 이상 징후를 탐지하는 AI 시스템 'Jev'를 소개합니다. Jev는 상태와 질문을 기반으로 확률과 확신도를 반환하며, 특히 생(raw) 로그 전체를 전달할 경우 오히려 공격에 취약해질 수 있음을 지적합니다. 따라서 로그를 집계한 후 숫자 조합만으로 판단하는 것이 비용 효율적이고 안전하다고 강조합니다.
핵심 포인트
- Jev는 상태와 질문을 기반으로 확률과 확신도를 반환하는 판정 전용 AI입니다.
- 생(raw) 로그 전체를 전달하면 오히려 공격자에게 정보를 노출할 위험이 있습니다.
- 로그 분석은 원본 데이터를 그대로 보내기보다, 집계된 숫자 조합만 사용하는 것이 안전하고 비용 효율적입니다.
정보 유출이 발생하면, 수백만 줄의 접근 로그에서 수상한 접근을 찾는 작업이 발생합니다. 이를 AI에 맡기는 시스템을, 문장을 쓰지 않는 판정 전용 AI 'Jev'(TypeSafe AI, 2026년 9월 발표)로 만들 때의 생각을 정리했습니다.
-
상태(문자열 또는 JSON)와 질문(선택식/채점/진위 여부)을 전달하면, 선택지별 확률과 확신도가 반환됩니다.
-
입력 100만 토큰당 $0.042이며, 출력은 과금되지 않습니다.
-
1 요청 당 64k 토큰(state는 최대 32k까지), 속도 제한은 80 요청/초입니다.
-
선택지 외의 내용은 답변하지 않으므로, 존재하지 않는 답을 만들지 않습니다.
-
판정 이유는 설명할 수 없으며, 일본어의 정확도는 영어보다 떨어집니다.
한 줄만 보여줘도 공격은 알 수 있다. POST /login 401
이는 Jev에서도 '보통'으로 판정됩니다(확신도 0.88) -
한 줄씩 전부 던지면, 질문 문장이 매번 포함됩니다. 하루 1,340만 줄의 사이트에서 Jev를 사용해도 월 약 111만 엔이며, 속도 제한의 2배에 달하는 요청이 발생합니다. -
5분 분량을 모아서 주면, state에 들어가지 않습니다(약 650만 토큰). 나누어 처리하면 문맥이 흐트러집니다. 생 로그를 전달하는 것 자체가, 공격자의 문자열을 AI에게 먹이는 공격 면이 됩니다.
로그를 '전달'하는 것이 아니라, 집계한 후에 전달합니다. 세는 것은 New Relic 측에서 하고, Jev는 숫자 조합만으로 '공격스러운지'를 판단할 뿐입니다. 이렇게 하면 월 2,000엔 이하로 유지됩니다.
Jev의 기본 정보, 첫 번째 샘플 결과, 생 로그를 전달하는 4가지 방식에 대한 월별 예상 비용을 게재했습니다. New Relic → Jev → AWS WAF의 완전한 소스 코드는 note의 유료 부분에 있습니다.
※2026년 10월 시점의 공개 정보와, 필자가 로그를 보고 있는 EC 사이트의 실측값에 근거한 예상치입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기