Open-source 모델 및 점수표를 이용한 LLM 환각 측정 방법 공개
요약
본 글은 오픈소스 환각 평가 모델(HEM)을 출시하며, LLM의 신뢰성 확보 방안을 제시합니다. HEM은 RAG 시스템이 검색된 결과를 얼마나 정확하게 요약하는지 측정하여, 환각 없이 정보를 추출할 수 있는 최적의 LLM을 선택하는 데 도움을 줍니다. 또한, 주기적인 평가 점수표를 통해 주요 모델들의 환각 경향성을 공개했습니다.
핵심 포인트
- 오픈소스 HEM 출시로 RAG 시스템 신뢰성 평가 가능
- HEM은 검색 결과 요약 시 환각 여부를 측정함
- 환각률과 정확도는 상호 역관계에 있음
- 주기적인 점수표 업데이트를 통해 모델 비교 제공
오늘, 저희의 오픈소스 환각 평가 모델(Hallucination Evaluation Model) 출시를 기쁘게 알려드립니다!
기업들이 생성형 AI 도입을 고려할 때 가장 우려하는 부분 중 하나는 LLM이 환각(hallucinations)을 생성할 가능성입니다. 환각은 비즈니스에 부정적인 영향을 미칠 수 있는 여러 형태로 나타납니다:
- 엔드유저의 질문에 답변하는 대신, 생성 모델이 완전히 궤도를 이탈하여 평판 손상을 초래할 수 있는 대규모 오류.
- 생성 시스템이 자체 지식 기반을 활용하여 출력물에 저작권이 있는 작품을 만들어내는 경우.
- 모델이 응답에서 현실에 근거하지 않은
이번 릴리스를 통해 우리는 생성형 LLM이 RAG 시스템의 일련의 결과를 얼마나 잘 요약할 수 있는지 평가하는 오픈 소스 모델인 HEM을 제작했습니다. 여기서 '잘'이라는 것은 과정에서 환각(hallucination)을 생성하지 않으면서 결과를 정확하게 요약하는 응답으로 정의했습니다. 이 모델을 사용하여 특정 사용 사례에 가장 적합한 LLM이 무엇인지 포함하여 RAG 시스템의 신뢰성을 평가하는 데 도움을 받을 수 있습니다. 우리가 이 모델과 해당 점수를 정확히 어떻게 제작했는지에 대한 자세한 내용은 관련 기술 블로그에서 확인할 수 있으며, 언제든지 최신 버전의 모델은 저희 Hugging Face 계정(여기)에서 찾으실 수 있습니다.
저희의 아이디어는 기업이 정량적 분석을 통해 생성형 시스템을 활성화하는 데 필요한 자신감을 가질 수 있도록 필요한 정보를 제공하는 것입니다. 따라서 이 모델을 Apache 2.0 라이선스로 오픈 소스화하여 사용자가 자체적인 특정 요구 사항에 맞게 조정할 수 있도록 했습니다.
저희 사용자 및 고객들처럼, Vectara 역시 요약 기능에 제3자를 사용하는 만큼 이러한 생성형 LLM의 품질에 투자하고 있습니다. 오늘날 저희는 Growth 사용자에게는 GPT-3.5를 기반으로 커스텀 튜닝된 프롬프트를, Scale 사용자에게는 GPT-4를 기반으로 한 다른 프롬프트를 제공합니다. 미래에는 고객들을 위해 다른 생성형 LLM을 구축하고 배포할 것으로 예상하지만, 이 과정에서 생성 결과의 품질(및 환각 감소)을 개선하고 있다는 점을 알려드립니다.
미래에 Growth 및 Scale 사용자에게 추가적인 생성형 LLM을 제공할 수 있습니다. 이러한 점과 고객 및 대중의 일반적인 관심사로 인해, 저희는 일부 가장 많이 사용되는 모델들이 얼마나 자주 환각하는지를 측정하는 평가 점수표를 만들었습니다. 이는 RAG 시스템에서의 환각에 대한 FICO 점수와 같은 것이라고 생각하시면 됩니다.
아래는 현재 점수표 요약본이지만, 최신 정보가 도착하고 다양한 LLM이 업데이트되며 새로운 LLM이 출시됨에 따라 이 점수표를 주기적으로 업데이트할 예정입니다. 이 점수표에는 네 개의 숫자 열이 있습니다. 설명드리겠습니다:
- 오른쪽에 있는 “답변률(Answer Rate)”은 모델이 질문에 대한 응답으로 결과를 요약하려고 시도한 빈도를 나타냅니다. 때때로 모델들은 검색된 결과에서 충분한 정보를 가지고 있지 않다고 잘못 추측하여 요약을 하지 못하기도 합니다. - “정확도(Accuracy)”와 “환각률(Hallucination Rate)” 수치는 서로 역의 관계에 있습니다. 환각률은 몇 퍼센트의 요약본에 환각이 포함되었는지를 나타내며, 정확도는 이 수치에서 100%를 뺀 값입니다. 이러한 환각이 정확히 어떻게 평가되었는지에 대한 자세한 내용은 기술 블로그 게시물에서 확인할 수 있습니다. - “평균 요약 길이(Average Summary Length)”는 요약본의 단어 수를 나타냅니다. 간결한 요약을 찾고 있다면, 이 숫자 최적화도 고려할 수 있으므로 포함했습니다.
표 1: 환각 평가 모델(HEM)을 이용한 LLM 환각 데이터 리더보드
새롭거나 업데이트된 모델들이 재평가됨에 따라, 저희는 환각 리더보드 GitHub 저장소에서 점수표를 최신 상태로 유지할 것입니다.
저희는 이 모델과 리더보드를 공개하는 데서 멈추지 않을 것입니다. 언급했듯이, 시간이 지남에 따라 모델의 개선 사항을 추적할 수 있도록 리더보드를 정기적으로 유지하고 업데이트할 것입니다. 하지만 저희는 또한 오픈 소스 모델 자체를 계속 개선하여 업데이트된 버전을 출시할 것입니다. 점수표와 모델을 오픈 소스로, 그리고 최신 상태로 유지하기 위해 커뮤니티와 협력하기를 기대합니다.
Vectara의 초점은 신뢰할 수 있는 검색을 제공하는 것이므로, 향후 몇 달 동안 이 모델의 기능을 플랫폼에 추가할 예정입니다. 즉, 최신 HEM(Hallucination Evaluation Model)을 기반으로 Vectara가 제공하는 답변에 대한 사실적 일관성 점수를 제공하는 것입니다. 앞으로도 저희는 GPT 3.5와 GPT 4가 제공하는 것보다 환각률을 더욱 낮출 수 있는 자체 요약 모델 개발을 모색할 것입니다. 저희는 환각을 정량화하고 줄이는 능력이 고객에게 최고의 생성형 기능을 제공하는 데 핵심이 될 것이라는 것을 알고 있습니다.
![SonoSim + Vectara: Success Story [Video]](/_next/image?url=https%3A%2F%2Fcdn.sanity.io%2Fimages%2Fp0pvmro2%2Fproduction%2F1e7487ce1b4e10732e1f956eb79f7e90617d85f0-494x315.jpg%3Fw%3D318%26fit%3Dmax%26auto%3Dformat&w=3840&q=100
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Research의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기