대규모 언어 모델(LLM)을 위한 견고한 확률적 안전 경계(Sound Probabilistic Safety Bounds)
요약
LLM이 유해한 출력을 생성할 확률에 대한 엄격한 확률적 경계를 계산하는 새로운 프레임워크를 제안합니다. 잠재 공간의 특징을 활용해 유해 가능성이 높은 생성 경로를 우선 탐색함으로써, 유해 확률이 매우 낮은 상황에서도 견고한 하한을 효율적으로 도출합니다.
핵심 포인트
- PAC(Probably Approximately Correct) 경계 계산을 위한 새로운 프레임워크 제안
- 잠재 공간 특징을 활용한 자기 회귀 생성 트리 탐색 알고리즘 개발
- 실제 유해 확률보다 작음이 증명된 견고한(sound) 하한 계산 가능
- LLM의 통계적 인증 및 안전성 평가를 위한 새로운 방법론 제시
우리는 대규모 언어 모델(LLM)이 주어진 프롬프트에 대해 유해한 출력을 생성할 확률에 대한 엄격한 경계(rigorous bounds)를 계산하기 위한 새로운 프레임워크를 제안합니다. 우리는 이 문제에 대해 아마도 대략적으로 정확한 (PAC, probably approximately correct) 경계를 얻기 위해 Clopper-Pearson 신뢰 구간(confidence intervals)의 새로운 적용 방법을 연구합니다. 우리의 주요 기술적 기여로서, 우리는 잠재 공간(latent space)의 특징을 활용하여 유해한 출력을 생성할 가능성이 더 높은 자기 회귀 생성 트리(auto-regressive generation tree) 내의 분기들을 우선적으로 탐색하는 알고리즘을 제안합니다. 특히 우리의 접근 방식은 실제 유해 확률이 극도로 작은 시나리오에서도 유용한 하한(lower bounds)을 효율적으로 계산할 수 있게 하며, 결정적으로 얻어진 하한은 견고(sound)합니다. 즉, 실제 유해성 확률보다 작다는 것이 형식적으로 증명됩니다. 우리의 실험 결과는 최첨단 LLM들에 대해 유의미한 하한을 계산함으로써 우리 방법의 효과를 입증합니다. 본 연구는 LLM의 평가 및 통계적 인증(statistical certification)을 새롭게 가능하게 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기