Penumbra: 규제 의무에 대한 샘플 효율적인 적대적 탐색
요약
본 글은 금융, 의료 등 규제 산업에서 AI 에이전트의 규정 준수(compliance)를 테스트하기 위한 새로운 적대적 탐색 기법 'Penumbra'를 소개합니다. Penumbra는 편집 예산 하에 작동하며, 검증된 기준점 주변을 이동하여 의무 위반 경계면을 효율적으로 커버하는 것이 목표입니다.
핵심 포인트
- Penumbra는 규제 준수 테스트의 샘플 효율성을 높이는 적대적 탐색 기법이다.
- 편집 예산(edit budget) 하에 작동하며, 기준점 주변에서 인접한 응답 쌍을 생성한다.
- 균일 할당 대비 1.43배 많은 실패 모드를 커버하여 규제 레드팀 운영에 효과적이다.
- 금융 자문 및 임상 분류 등 실제 시나리오에서 의무 위반 경계선을 성공적으로 탐지했다.
에이전트들이 금융, 의료, 법률과 같은 분야에 진출하고 있으며, 이 분야들에서는 위반이 어떠한 텍스트상의 흔적도 남기지 않으면서 실제적인 처벌을 수반합니다. 누락된 내용이 중요한지, 또는 공개가 충분했는지 여부는 응답이 무엇을 빠뜨렸는지에 따라 달라집니다. 이러한 의무를 탐색한다는 것은 규정 준수(compliance)를 뒤집는 최소한의 편집만으로 가능한 응답들을 찾는 것을 의미하며, 모든 탐색은 한 번의 생성과 두 번의 심사를 비용으로 요구하므로, 규제 레드팀 운영에 대한 제약 조건은 볼륨이 아닌 샘플 효율성입니다. 우리는 Penumbra라는 적대적 탐색을 소개합니다. 이는 검증된 기준점(anchor)에서 시작하여 확장되는 편집 예산(edit budget) 하에 이동하며, 두 평가자 위원회(two-evaluator committee)가 판결을 변경할 때까지 진행하고, 그 변화를 가로지르는 인접한 두 응답을 방출합니다. 할당은 적응적이며, 목표는 '실패 표면(defeat surface)'의 커버리지입니다: 후보별로 구별되는 (의무 x 실패 모드) 셀이 해결됩니다. 일치하는 예산에서, 적응적 할당은 59%의 후보에 대해 균일 할당(uniform allocation)의 전체 예산 커버리지를 달성합니다; 동일한 기록에서는 단순 열거(naive enumeration)보다 1.43배 많은 실패 모드를 커버하며, 이 이득은 목표로 하는 축에 국한됩니다. 금융 자문 규약의 60개 검토된 의무에 대해, Penumbra는 144쌍을 반환합니다. 각 쌍은 준수하는 응답과 위반하는 응답으로 구성되며, 위원회는 이들을 경계선 양쪽에 배치하고, 그 차이는 몇 단어에 불과한데, 모델이 둘 다 직접 요청할 경우 거의 아무것도 공유하지 않는 텍스트를 생성합니다. 임상 분류(clinical triage)를 위한 두 번째 규약의 경우, 이는 18개 의무에 대해 이와 유사하게 재현됩니다: 동일한 타이트함에서 49쌍을 얻었으며, 가장 어려운 모드도 동일했습니다. 이러한 쌍들은 의무 자체의 조건이 결정하는 것을 멈추는 지점을 보여주며, 이것이 에이전트가 배치되어 테스트되어야 하는 부분입니다. 그리고 이 탐색은 텍스트가 아닌 경계선에 비례하여 비용이 증가합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기