랜덤 포레스트를 위한 분포 기반 분할 기준: 확장, 수축, 그리고 평균 분할의 강건성
요약
랜덤 포레스트의 분할 기준을 평균 기반에서 분포 기반으로 확장하는 다양한 방법론을 연구하고 비교합니다. 실험 결과, 다변량 반응 예측에서는 분포 기반 방식이 효과적이지만, 일반적인 스칼라 회귀에서는 기존 CART 방식이 여전히 강력함을 확인했습니다.
핵심 포인트
- 분포 기반 분할은 비위치 구조가 존재할 때 유효함
- 다변량 반응 예측 영역에서 분포 기반 방식의 가치 증명
- 등방성 MMD 기준이 다른 확장 방식보다 우수한 성능을 보임
- Rust 기반의 오픈 소스 drforest 라이브러리 구현
분포 기반 랜덤 포레스트 (Distributional random forests)는 평균 기반의 CART 분할을 후보 자식 노드 간의 전체 조건부 반응 분포 (conditional response distribution)를 비교하는 기준으로 대체합니다. 우리는 단일 정직한 포레스트 (honest-forest) 구현체 내에서 다음과 같은 일련의 기준들을 구현하고 체계적으로 연구합니다: 등방성 랜덤 푸리에 특징 최대 평균 불일치 (isotropic random-Fourier-feature maximum mean discrepancy, MMD), 비등방성 대각 밴드폭 변형 (anisotropic diagonal-bandwidth variant), 적응형 분할별 빈도 선택 변형 (adaptive per-split frequency-selection variant), 그리고 비커널 슬라이스 와서스테인 기준 (non-kernel sliced-Wasserstein criterion), 그리고 포레스트 가중치에 대한 사후 커널 평균 수축 (post-hoc kernel-mean shrinkage)입니다. 합성 분위수 메커니즘 (synthetic quantile mechanisms), 실제 단변량 벤치마크, California-housing 하위 샘플 곡선, 그리고 다변량 합성 및 실제 반응에 대한 쌍을 이룬 시드 비교 (paired-seed comparisons)를 사용하여, 각 확장이 효과를 발휘하는 지점을 규명합니다. 세 가지 결과가 반복적으로 나타납니다. 첫째, 분포 기반 기준들 중에서 일반적인 등방성 MMD는 이미 해당 범주에서 최고 수준에 가깝습니다. 즉, 비등방성, 적응형 빈도, 슬라이스 와서스테인 확장 및 사후 수축이 이를 체계적으로 개선하지는 못합니다. 둘째, 스칼라 표 형식 회귀 (scalar tabular regression)에서는 평균 기반 CART 분할이 여전히 강건한 기본값(default)으로 남아 있으며 많은 경우에서 승리합니다. 셋째, 다변량 반응 (multivariate responses)은 분포 기반 분할이 확실히 가치를 증명하는 영역이며, 특히 한계 CRPS (marginal CRPS)는 기준들을 구분하지 못하더라도 에너지 점수 (energy score)가 기준들을 구분해내는 순수 의존성 코풀라 (pure-dependence copula)에서 가장 두드러집니다. 이러한 증거는 단순한 할당 논리를 뒷받침합니다: 분포 기반 분할은 비위치 구조 (non-location structure)가 존재하고 추정 가능할 때만 도움이 되며, 그렇지 않으면 분할 선택 능력을 평균으로부터 희석시킵니다. 모든 기준, 정직한 포레스트, 그리고 쌍 비교 도구는 오픈 소스 exttt{drforest} 라이브러리에 구현되어 있으며, 이 라이브러리의 Rust 기반 분할 탐색은 광범위한 기준 스윕 (criterion sweeps)을 저렴하게 수행할 수 있게 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기