예측 가능한 환각: LLM의 사실적 회상 (Factual Recall)은 모델 크기와 주제 빈도에 따라 확장된다
요약
LLM의 사실적 회상(Factual Recall) 성능이 모델 파라미터 수와 학습 데이터 내 주제 빈도의 로그 선형 결합에 따라 시그모이드 형태로 확장됨을 밝혀냈습니다. 연구 결과, 이 두 변수만으로 모델 간 성능 분산의 상당 부분을 설명할 수 있으며, 이는 회상 능력이 신호 대 잡음비(SNR)에 의해 제어된다는 이론과 일치합니다.
핵심 포인트
- 사실적 회상 성능은 모델 크기와 주제 빈도의 로그 선형 결합에 따른 시그모이드 형태를 따름
- 두 변수만으로 밀집 모델 간 성능 분산의 60%, 제품군 내에서는 74~94%를 설명 가능
- 신호 강도는 개념 빈도에 따라 확장되고, 잡음 바닥은 모델 용량에 따라 확장됨
- 회상 품질이 신호 대 잡음비(Signal-to-noise ratio)에 의해 제어된다는 중첩 기반 설명과 일치함
확장 법칙 (Scaling laws)이 거대 언어 모델 (LLM)의 종합적인 성능을 지배하고 있지만, 사실적 회상 (Factual recall)을 모델 크기와 학습 데이터 구성 모두와 연결하는 확장 법칙은 아직 없습니다. 우리는 자동화된 참조 검증 시스템 (Automated reference verification system)을 통해 평가된 8,900개 이상의 학술 참조 문헌을 바탕으로 38개의 모델을 평가했습니다. 회상 품질은 모델 파라미터 수 (Model parameter count)와 학습 데이터 내 주제 표현도 (Topic representation)의 로그 선형 결합 (Log-linear combination)에 따른 시그모이드 (Sigmoid) 형태를 따릅니다. 이 두 변수만으로 4개 제품군에 속한 16개 밀집 모델 (Dense models) 간 분산의 60%를 설명할 수 있으며, 개별 제품군 내에서는 74~94%까지 상승합니다. 이러한 형태는 회상이 신호 대 잡음비 (Signal-to-noise ratio)에 의해 제어된다는 중첩 (Superposition) 기반의 설명과 일치합니다. 즉, 신호 강도 (Signal strength)는 개념 빈도 (Concept frequency)에 따라 확장되고, 잡음 바닥 (Noise floor)은 모델 용량 (Model capacity)에 따라 확장됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기