사기 탐지: 규칙 기반 엔진의 한계점
요약
규칙 기반 사기 탐지는 구현이 빠르고 설명 가능하며 알려진 패턴을 포착하는 데 유용합니다. 하지만 사기범들이 규칙에 적응하고 새로운 공격 벡터가 나타날 경우, 이를 코딩하는 데 시간이 걸리는 '탐지 격차'라는 근본적인 한계점을 가집니다. 머신러닝은 이러한 한계를 넘어 통계적으로 비정상적인 패턴을 포착할 수 있습니다.
핵심 포인트
- 규칙 엔진은 알려진 사기 패턴에 강하지만, 새로운 공격에는 취약합니다.
- 사기범들은 규칙 기반 차단에 적응하여 행동을 수정하는 경향이 있습니다.
- ML은 아직 코딩되지 않은 통계적 비정상 패턴을 포착할 수 있는 장점이 있습니다.
- 규칙 엔진은 지리적 제한 등 엄격한 비즈니스 제약 조건에 필수적입니다.
규칙 기반 사기 탐지는 배포가 빠르고 설명하기 쉽습니다. 하지만 한계점도 있습니다. 사기범들은 규칙에 적응하고, 오탐률(false positive rates)을 낮추기 어렵고, 새로운 사기 패턴을 코딩하는 데 시간이 걸립니다. 머신러닝(ML)은 이 한계점을 넘어설 수 있는 측정 가능한 성능 향상을 제공하며, 실제 사례에서 어떻게 작동하는지 살펴보겠습니다.
대부분의 금융 기관들은 규칙 엔진으로 사기 탐지를 수행합니다. 특정 금액을 초과하는 거래를 비정상적인 수신처로 차단하거나, 임계치를 넘는 속도 패턴(velocity patterns)에 플래그를 지정하고, 짧은 시간 내 여러 지역에서 사용된 카드를 거절하는 식입니다. 이러한 규칙들은 작동하며, 상당한 비율의 사기를 포착합니다. 또한 구현이 빠르고, 규제 당국에 설명하기 쉬우며, 운영팀에게 투명하다는 장점을 가지고 있습니다. 하지만 대부분의 기관들이 이미 도달한 한계점도 존재합니다.
규칙 엔진은 알려진 사기 패턴을 정적으로 표현한 것입니다. 사기범들은 이에 적응합니다. 특정 공격 패턴이 충분한 규칙 기반 차단을 유발하면, 사기 조직은 임계치 이하로 머무르기 위해 행동을 수정합니다. 즉, 거래 금액을 낮추거나, 속도를 늦추고, 지리적으로 더 그럴듯한 패턴을 보입니다. 작년에 사기를 포착했던 규칙들이 올해는 더 적게 포착하게 되고, 이 격차를 메우기 위해 새로운 규칙을 추가하면 정상적인 거래에서 오탐률이 증가합니다.
핵심 통찰: 규칙은 이미 목격하고 코딩한 사기 패턴을 포착합니다. ML은 아직 규칙으로 작성되지 않았지만 통계적으로 비정상적인 패턴, 즉 새로운 사기가 나타나는 곳의 패턴을 포착합니다.
_
이는 결정론적이며(deterministic) 감사 가능합니다(auditable). 거래가 차단될 경우, 운영팀은 고객에게 어떤 규칙이 거절을 유발했는지 정확하게 알려줄 수 있습니다. 이러한 투명성은 고객 관계와 규제 검사에서 중요합니다.
또한 빠릅니다. 규칙 평가(Rule evaluation)는 계산적으로 사소하여 — 거래당 마이크로초 단위입니다. 대형 금융기관이 처리하는 거래량에서는 지연 시간(latency)이 중요합니다.
알려지고 잘 정의된 공격 패턴을 신뢰성 있게 처리합니다. 새로운 계정에서의 높은 속도의 카드 미사용 사기(Card-not-present fraud), 자격 증명 채우기 패턴을 이용한 계정 탈취(account takeover), 특정 계좌 간 타이밍 서명을 가진 수표 킹이팅(check kiting) — 이러한 패턴들은 규칙으로 코딩되어 높은 정밀도로 포착할 수 있습니다.
규칙은 또한 통계적 패턴에 관한 것이 아닌, 엄격한 비즈니스 제약 조건에도 적합합니다. 지리적 제한(geographic restrictions), 제품 적격성 요구 사항(product eligibility requirements), 규제 보류(regulatory holds) 등이 이에 해당합니다. 이들은 ML 레이어(ML layer)가 아무리 정교하더라도 규칙 엔진에 속해야 합니다.
규칙은 엄격한 비즈니스 제약 조건과 잘 정의된 알려진 패턴에 적합한 도구이며 — 아직 코딩되지 않은 사기 패턴을 탐지하는 데는 적합하지 않습니다
한계점(Where the Ceiling Is)
규칙 기반 탐지의 한계점은 세 가지 방식으로 나타납니다.
첫째, 새로운 사기 패턴입니다. 새로운 공격 벡터가 나타날 때 — 새로운 합성 신원 구조(synthetic identity structure), 새로운 카드 미사용 익스플로잇(card-not-present exploit), 새로운 계좌 자금 조달 방식(account funding scheme) 등 — 해당 패턴을 탐지하고, 분석하고, 규칙을 작성하고, 테스트하고, 배포하는 데 시간이 걸립니다. 이 기간 동안 사기 손실이 누적됩니다. 새로운 사기가 나타나는 시점과 규칙이 이를 포착하는 시점 사이의 탐지 격차(detection gap)는 일반적으로 몇 주에서 몇 달에 이릅니다.
둘째, 정밀도-재현율 트레이드오프(precision-recall tradeoff) 문제입니다. 사기를 더 많이 포착하기 위해 규칙을 추가할수록 정상 거래에서 오탐지율(false positives)이 증가합니다. 어느 시점부터는 다음 규칙으로 잡아낼 수 있는 한계적인 사기 건수가, 그 규칙이 만들어내는 추가적인 오탐지 건수에 따른 고객 마찰 비용과 수동 검토 비용보다 적어집니다. 대부분의 성숙한 규칙 엔진은 이미 이 지점에 도달했거나 이를 넘어섰습니다.
셋째, 적대적 적응(adversarial adaptation) 문제입니다. 자체적으로 차단율을 관측할 만큼 규모가 큰 사기 조직들은 트리거되는 규칙을 피하기 위해 행동 방식을 수정합니다. 이는 카드 사기, 계좌 개설 사기, 자금 이동 사기 등에서 잘 문서화되어 있습니다. 18개월 전에 효과적이었던 규칙은 사기 행태가 이를 회피하도록 바뀌었기 때문에 오늘날에는 덜 효과적입니다.
새로운 패턴, 오탐지 상한선(false positive ceilings), 그리고 적대적 적응은 규칙 기반 탐지 시스템이 지속적으로 성능이 떨어지는 세 가지 벡터입니다.
머신러닝(ML)이 추가하는 것들
머신러닝 사기 탐지 모델—그래디언트 부스팅 분류기, 신경망, 그래프 기반 이상 감지 등—은 규칙과는 다른 메커니즘을 통해 사기를 포착합니다. 이들은 정상 거래의 통계적 프로필을 학습하고, 그 프로필에서 벗어나는 편차를 플래그 지정하며, 그러한 편차가 특정 미리 정의된 패턴과 일치할 필요가 없습니다.
이는 아직 규칙으로 명문화되지 않은 사기를 잡아낼 수 있다는 의미입니다. 새로운 합성 신원(synthetic identity) 방식은 기존의 어떤 규칙도 트리거하지 않을 수 있지만, 잘 훈련된 모델이 감지하는 방식으로 정상적인 신규 계좌의 통계적 프로필에서 벗어나는 모습을 보일 것입니다. 사기범들은 단순히 특정 임계값을 피하는 것을 넘어, 정상 고객의 전체 행동 및 인구통계학적 분포를 완벽하게 모방해야만 모델 기반 탐지기를 회피할 수 있습니다.
규칙에 ML을 추가하는 것이 가져오는 측정 가능한 개선 효과(lift)는 기관과 사기 유형별로 크게 다릅니다. 카드 사기의 경우, 동일한 오탐률(false positive rates)에서 사기 손실을 15~30% 감소시키는 개선 효과가 일반적으로 보고됩니다. 계좌 개설 사기나 합성 신원 도용(synthetic identity fraud)의 경우, 이러한 사기 유형들이 규칙으로 코딩하기 더 어렵기 때문에 개선 효과가 더 클 수 있습니다.
ML이 규칙 엔진을 대체하는 것은 아닙니다. 이 둘은 단독으로 작동할 때보다 함께 작동할 때 훨씬 더 잘 작동합니다. 하드 제약 조건(Hard constraints)은 규칙에 속해야 합니다. 통계적 이상 탐지(Statistical anomaly detection)는 ML 계층에 속해야 합니다. 대부분의 프로덕션 사기 스택(production fraud stacks)은 이 둘을 모두 사용합니다.
ML은 규칙이 코딩할 수 없는 통계적 이상 징후를 포착하여 동일한 오탐률에서 15~30%의 사기 손실 감소를 가져옵니다. 이는 규칙 대신 작동하는 것이 아니라, 규칙과 함께 작동합니다.
적대적 환경에서의 모델 드리프트(Model Drift)
사기 탐지 모델은 대부분의 ML 모델이 직면하지 않는 도전을 안고 있습니다. 바로 모델이 배포된 이후에 그 모델이 학습한 분포 자체가 공격자(adversary)에 의해 적극적으로 조작된다는 점입니다.
지난해 고객 데이터를 기반으로 훈련된 이탈 예측 모델(churn prediction model)은 고객 행동이 자연스럽게 진화했기 때문에 올해는 정확도가 떨어집니다. 지난해 사기 패턴을 기반으로 훈련된 사기 모델 역시, 부분적으로는 사기 행동 자체가 자연스럽게 진화했고, 또 다른 부분으로는 사기 주체들이 모델의 탐지 패턴을 회피하기 위해 특별히 적응했기 때문에 올해는 정확도가 떨어집니다.
이는 사기 모델이 대부분의 ML 애플리케이션보다 더 자주 재훈련(retraining)되어야 함을 의미합니다. 고빈도 카드 사기의 경우 최소 분기별로, 새로운 공격 벡터가 나타나는 경우에는 더 자주 해야 합니다. 또한 이는 학습 데이터 파이프라인을 신중하게 유지해야 한다는 것을 의미합니다. 즉, 새로 라벨링된 사기 사례(labelled fraud examples)를 빠르게 통합해야 하며, 라벨링 과정(사기를 확인하기 위해 조사 및 차지백(chargebacks)이 필요한 과정)은 유용한 학습 신호(training signal)를 생성할 만큼 충분히 시의적절해야 합니다.
사기 탐지 모델의 드리프트(drift) 모니터링은 허위 양성률(false positive rate, FPP)과 사기 탐지율(fraud detection rate)을 모두 추적해야 합니다. (FPP는 정상 거래에서의 모델 성능 저하를 포착하고, 사기 탐지율은 사기 관련 모델 성능 저하를 포착합니다.) 만약 사기 분포가 이동하면 이 두 지표는 독립적으로 저하될 수 있습니다.
사기 모델은 적대자(adversary)가 능동적으로 적응하기 때문에 대부분의 ML 애플리케이션보다 더 자주 재학습이 필요합니다. 분기별 재학습은 목표라기보다는 최소한의 기준입니다.
원문 출처: CobuildX 블로그.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기