PaMIR: 공공 신용 부도 데이터셋의 개방형 벤치마크
요약
본 글은 신용 부도 예측을 위한 개방형 벤치마크인 PaMIR를 공개합니다. PaMIR는 9개국에서 수집된 19개의 공공 데이터셋과 124만 건의 대출/기업/카드 계좌 정보를 포함하며, 기존 연구 대비 독보적인 시스템입니다. 이 벤치마크는 레이블 지연 스트림 환경을 시뮬레이션하여 모델 성능을 평가합니다.
핵심 포인트
- 신용 부도 예측을 위한 개방형 벤치마크 PaMIR를 공개함.
- 9개국, 19개 공공 데이터셋(1.24M 건)으로 구성되어 신뢰성이 높음.
- 레이블 지연 스트림 환경에서 모델 성능 평가가 가능함.
- 합성 데이터 하네스를 통해 누수 없는 테스트 환경을 제공함.
우리는 레이블이 부족하고 도착하는 시점이 늦는 경우의 신용 부도 예측을 위한 개방형 벤치마크인 PaMIR (Public Arrival-ordered Measurement for Inference in Risk)를 공개합니다. 이 분야의 기존 참고 벤치마크 연구들은 각각 여덟 개의 데이터셋을 사용하며, 그중 공공으로 공개된 것은 단 두세 개에 불과했습니다. PaMIR는 nine개 국가에서 나온 19개의 공공 데이터셋을 모았으며, 여기에는 바이너리 부도 레이블이 포함되어 있고 총 1.24M 개의 대출, 기업 및 카드 계좌가 있습니다. 이 데이터셋들은 누수 감사를 거친 레시피(recipe)를 통해 고정된 소스 스냅샷에서 재구축되었으며, 재배포된 적이 없습니다. 이는 현재까지 우리가 아는 한 독보적인 시스템입니다. 모든 모델은 단일 함수이며, 반복적인 i.i.d. 분할과 레이블 지연 스트림(label-delayed stream) 하에서 점수가 매겨집니다. 이 과정에서는 각 애플리케이션이 도착 시점에 따라 점수를 받으며, AUC는 레이블 예산에 의해 보고됩니다. 모든 데이터셋에 대해 점수가 매겨지지 않는 한 평균값은 공개되지 않습니다. 합성 데이터 하네스(synthetic-data harness)는 생성기가 보류된 행(held-out rows)을 볼 수 없도록 하면서 생성된 훈련 행을 테스트합니다. 본 리포트는 이 살아있는 벤치마크의 release 0.4.0에 대해 설명합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기