생성적 검색에서 패러다임, 식별자 및 디코딩 분리
요약
본 연구는 생성적 검색(Generative retrieval)에서 식별자, 훈련 방식, 디코딩 방식을 분리하여 각 요소의 기여도를 분석했습니다. 다양한 양자화 및 모델 구조를 사용하여 성능을 측정했으며, 특히 원-패스 스코어링(one-pass scoring)이라는 새로운 디코딩 방식으로 확산 검색기의 성능을 크게 향상시킬 수 있음을 입증했습니다.
핵심 포인트
- 디코딩 방식만으로도 확산 모델의 Hit@1 점수를 크게 개선할 수 있습니다.
- 원-패스 스코어링은 기존 generate-and-match 대비 격차를 대폭 줄여 성능을 높였습니다.
- 자기회귀식(AR) 모델이 여전히 전반적인 성능에서 우위를 보였으나, 디코딩 방식의 중요성이 강조되었습니다.
생성적 검색(Generative retrieval)은 언어 모델이 관련 문서의 식별자(identifier)를 생성하도록 훈련합니다. 최근 연구에서는 자기회귀식 디코더(autoregressive decoder)를 확산(diffusion) 방식으로 대체했지만, 식별자, 훈련 방식, 디코딩 방식을 한 번에 변경했기 때문에 그 차이를 패러다임 자체의 공로로 돌릴 수 없습니다.
NQ320K와 MS300K 데이터셋에서 우리는 잔차 양자화(residual-quantised), 곱셈 양자화(product-quantised) 및 임의 식별자(random identifiers)를 사용하여 자기회귀식, 마스크드-확산(masked-diffusion), 블록-확산(block-diffusion) 모델을 훈련했습니다. 식별자의 길이와 훈련 예산을 고정한 상태에서, 우리는 각 모델을 여러 방식으로 디코딩합니다. 디코딩만으로도 확산 모델의 Hit@1 점수를 6.6점에서 13.7점으로 향상시킬 수 있습니다. 우리의 기준이 되는 확산 디코딩 방식인 generate-and-match는 식별자를 생성한 다음, 가장 가까운 코퍼스 식별자들을 검색합니다. 이렇게 생성된 식별자는 NQ320K 질의의 1421%에 적합했습니다. 우리는 확산 검색기(diffusion retrievers)를 디코딩하기 위해 원-패스 스코어링(one-pass scoring)을 테스트했습니다: 이 모델은 완전히 마스크된 식별자를 한 번 읽고, 각 문서는 그 코드의 확률로 점수를 받습니다. 이는 generate-and-match와 12가지 설정 중 11가지에서 일치하거나 능가하는 성능을 보였습니다. 자기회귀식 모델이 여전히 Hit@1에서 선두를 차지했습니다; NQ320K에서 이 우위는 모델 자체에서 비롯된 것이지 비어 검색(beam search) 때문은 아니었습니다. 단일 샘플링된 식별자부터 시작하는 원-패스 스코어링은 마스크드 확산 방식의 비어 검색 대비 4683%의 격차를 줄였으며, generate-and-match 대비로는 최대 25%까지 줄였습니다.
NQ320K에서 모든 패러다임은 어떤 식별자가 어떤 질의에 답하는지를 크게 암기합니다: 임의 식별자는 잔차 양자화된 것의 Hit@1 중 8390%를 유지했습니다. 이 경우, 곱셈 양자화된 식별자는 자기회귀식 모델에서 잔차 양자화된 것보다 3.4점 앞섰고, 확산 모델에서는 -0.7점에서 +3.6점 사이의 차이를 보였습니다; 모든 디코딩 방식을 통틀어 볼 때, AR 방식의 격차는 확산 방식보다 1.52.3점 더 커서, 우리의 2점 임계값 근처에 위치했습니다. 패러다임 비교 시에는 각 패러다임을 그 자체의 방식으로 그리고 최적의 디코딩 방식을 사용하여 보고해야 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기