BayesPO: 병렬 템퍼링 경사도 유도 이산 MCMC를 통한 베이지안 프롬프트 최적화
요약
BayesPO는 프롬프트 최적화를 이산 토큰에 대한 베이지안 사후 샘플링 문제로 정의하는 새로운 연구 프레임워크입니다. 병렬 템퍼링과 Langevin 기반 Gibbs 샘플러를 결합하여 LLM의 복잡한 에너지 지형에서 전역적 최적 프롬프트를 탐색합니다.
핵심 포인트
- 프롬프트 최적화를 에너지 기반 사후 샘플링 문제로 변환
- 병렬 템퍼링을 통해 지역 최적점 탈출 및 전역 탐색 성능 향상
- Qwen2.5 실험 결과, 지시문 유도 작업에서 APE 대비 정확도 개선
- 계산 비용 문제와 작은 최적화 세트에 대한 과적합 가능성 확인
프롬프트 최적화 (Prompt optimization)는 모델 파라미터를 업데이트하지 않고 대규모 언어 모델 (LLMs)을 적응시키지만, 많은 자동 프롬프트 최적화 도구들은 여전히 후보 지시문들에 대한 휴리스틱 탐색 절차로 남아 있습니다. 본 논문은 프롬프트 최적화를 이산 프롬프트 토큰 (discrete prompt tokens)에 대한 베이지안 사후 샘플링 (Bayesian posterior sampling)으로 연구합니다. 우리는 입력-출력 예시를 설명하는 프롬프트에 보상을 주는 작업 가능도 (task likelihood) 항과, 유창한 지시문을 선호하는 언어 모델 사전 확률 (language-model prior) 항을 결합하여 사후 분포를 정의합니다. 이는 프롬프트 최적화를 에너지 기반 사후 샘플링 문제로 변환하며, 이를 위해 경사도 (gradients)를 사용하여 어휘 토큰 (vocabulary tokens)에 대한 이산 마르코프 연쇄 몬테카를로 (MCMC) 제안을 유도할 수 있습니다. 우리는 이 프레임워크를 Bayesian Prompt Optimization의 약자인 BayesPO라고 부릅니다. 본 논문에서 BayesPO는 마르코프 연쇄 몬테카를로 (MCMC)로 구체화됩니다. 즉, Metropolis-Hastings로 보정된 Langevin 기반 Gibbs (GwL) 제안을 사용하며, 험난한 LLM 유도 에너지 지형 (energy landscapes)의 전역적 탐색을 위해 병렬 템퍼링 (parallel tempering)을 통합합니다. 구체적인 샘플러는 가중치 공유가 되지 않는 (non-weight-tied) LLM 임베딩의 실질적인 제약 조건에 맞춰 GwL 샘플러를 추가로 적응시킵니다. Qwen2.5 모델을 이용한 실험 결과, 이 샘플러가 진단 작업에서 의미론적으로 유의미한 프롬프트를 발견하며, 병렬 템퍼링이 시 쓰기 완성 작업에서 지역 최적점 (local optimum)을 벗어나는 데 도움을 주고, 24개의 지시문 유도 (instruction-induction) 하위 작업에서 APE 프롬프트를 사후 최적화했을 때 평균 정확도가 60.04%에서 63.23%로 향상됨을 보여줍니다. 또한 본 연구는 두 가지 주요 한계점을 밝혀냈습니다: 에너지 최소화가 작은 최적화 세트에 과적합 (overfit)될 수 있다는 점과, 현재의 샘플러가 여전히 계산 비용이 많이 든다는 점입니다. 이러한 발견은 베이지안 프롬프트 샘플링을 원칙적인 사후 최적화 도구로 자리매김하게 하며, 확률적 프롬프트 최적화 (probabilistic prompt optimization)를 위한 유망한 방향을 제시합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기