Nemotron에게 그리스어 가르치기: 전문 분야 전반에 걸친 현대 그리스어를 위한 코퍼스 마이닝, 검색 적응 및 생성 그라운딩
요약
NVIDIA Nemotron 모델을 현대 그리스어 RAG 시스템에 최적화하기 위한 엔드 투 엔드 적응 연구를 소개합니다. 코퍼스 마이닝부터 리랭커, 리더 미세 조정을 통해 검색 성능과 생성 답변의 정확도를 획기적으로 향상시켰습니다.
핵심 포인트
- Nemotron 1B 임베더의 nDCG@10 성능을 0.362에서 0.835로 대폭 개선
- Nemotron 30B-A3B 리더의 LoRA 튜닝으로 답변 정확도를 29.4%에서 66.9%로 향상
- 그리스어 RAG 연구를 위한 새로운 벤치마크 HERA 공개
- 전문 분야 코퍼스 활용을 통한 검색 및 생성 그라운딩 최적화
현대 그리스어는 법률, 에너지, 금융 및 의료 분야의 검색 증강 생성 (RAG)에 중요함에도 불구하고, NVIDIA의 Nemotron 검색 모델과 주요 다국어 검색 벤치마크에서 누락되어 있습니다. 우리는 코퍼스 마이닝 (Corpus mining), 합성 감독 (Synthetic supervision), 검색 모델 학습, 리랭커 (Reranker) 적응, 리더 (Reader) 미세 조정 (Fine-tuning), 그리고 HERA라고 불리는 새로운 벤치마크를 포함하여 현대 그리스어를 위한 Nemotron 검색 스택의 엔드 투 엔드 (End-to-end) 적응을 제시합니다. 우리의 연구는 파라미터가 없는 BM25 베이스라인이 전문적인 그리스어 코퍼스에서 여러 기성 다국어 밀집 검색 (Dense retrieval) 모델보다 성능이 뛰어남을 보여줍니다. 65,773개의 그리스어 검색 쌍을 통해 미세 조정을 거친 후, Nemotron 1B 임베더 (Embedder)는 nDCG@10을 0.362에서 0.835로 향상시켰으며, 적응되지 않은 기존 모델을 실질적으로 능가합니다. 학습된 언어 능력은 일반 도메인의 그리스어로 전이되지만, BM25 대비 이점은 도메인에 따라 달라집니다. 우리는 추가로 크로스 인코더 (Cross-encoder) 리랭커를 적응시켰으며 전문 분야 전반에 걸쳐 일관된 개선을 입증했습니다. 마지막으로, 우리는 근거 기반 생성 (Grounded generation)을 위해 Nemotron 30B-A3B 전문가 혼합 (Mixture-of-experts) 리더를 LoRA 튜닝하여, 판단된 답변의 정확도를 29.4%에서 66.9%로 높이는 동시에 충실도 (Faithfulness)와 인용 품질을 크게 향상시켰습니다. 또한 우리는 검색 증강 생성 (RAG)을 위한 최초의 대규모 그리스어 벤치마크인 HERA를 소개하며, 그리스어 RAG 시스템에 대한 향후 연구를 지원하기 위해 우리가 적응시킨 모델과 벤치마크를 공개합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기