OpenAI 호환 API 뒤에서 실제로 실행되는 LLM 모델이 주장하는 것과 일치하는지 검증하고, 모델 교체 및 정적 측정 양자화(Static
요약
OpenAI 호환 API를 사용하는 LLM이 실제 성능을 속이는 '대리 기만' 행위를 탐지하는 연구를 소개합니다. 모델의 출력 분포를 통해 행동 지문을 생성하여 모델 교체나 양자화 여부를 검증합니다.
핵심 포인트
- API 뒤의 실제 모델이 주장하는 사양과 일치하는지 검증 가능
- 로짓이나 가중치 접근 없이 출력 분포만으로 탐지 수행
- 100~400회의 요청만으로 모델의 행동 지문 생성 가능
- 모델 교체 및 정적 측정 양자화 등 기만 행위 탐지
OpenAI 호환 API 뒤에서 실제로 실행되는 LLM 모델이 주장하는 것과 일치하는지 검증하고, 모델 교체, 정적 측정 양자화 (Static Measurement Quantization) 등 대리 기만 (Proxy Deception) 행위를 탐지합니다.
모델이 「1에서 100 사이의 무작위 숫자」와 같은 단어 기반 문제에 답할 때 나타나는 출력 분포를 통해 행동 지문 (Behavioral Fingerprint)을 생성합니다. arXiv 2607.10252에 기반한 이 방법은 로짓 (Logits)을 보지 않고 가중치 (Weights)에 접근하지 않으며, 100~400회의 완성 (Completion) 요청만으로 결과를 도출할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @qingq77 (검증됨)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기