반복 생성과 자체 평가의 효과성
요약
본 글은 Gemma 4 12B를 활용하여 유튜브 스크립트 요약본을 생성하고, 모델이 자체적으로 최적의 결과물을 선택하는 과정을 테스트한 연구 내용을 공유합니다. 여러 후보 요약본 간의 비교 및 평가 과정에서 유의미한 패턴과 효율적인 평가 방법을 제시합니다.
핵심 포인트
- 모델은 후자의 예시를 선호하는 경향을 보였으며, 이를 상쇄하기 위한 추가 라운드가 필요했습니다.
- 선택 전에 정당성을 부여하는 과정이 반드시 필수적이지는 않지만, 판단은 무작위가 아니었습니다.
- 모든 쌍 비교(quadratic time)가 최적의 결과를 찾는 데 필수는 아닐 수 있습니다. 효율적인 순위 매기기 방법도 고려할 수 있습니다.
- 평가를 위해 Bradley-Terry 모델 기반 최대 우도 추정(MLE)을 사용한 코드를 공유했습니다.
저는 gemma4 12B를 사용하여 유튜브 영상 스크립트의 타임스탬프 기반 요약본을 작성하게 했습니다. 이 요약본들이 유의미한 질적 변화를 보이는지, 그리고 SLM(Small Language Model)이 스스로 가장 좋은 것을 선택할 수 있는지 테스트했습니다. 아래에 제가 사용했던 프롬프트 텍스트를 공유합니다.
"{{[INPUT]}}<attachement name='original'>", 문서, "</attachment>위에 스크립트가 있습니다. 주제별로 시간 범위를 나누고 소제목을 지정하세요. 각 소제목 아래에 간략한 요약을 삽입하세요.{{[OUTPUT]}}", "{{[INPUT]}}", "<attachment name='Summary A'>", ans1, "</attachment>", "<attachment name='Summary B'>", ans2, "</attachment>위에 스크립트와 두 개의 요약본 A와 B가 있습니다. 더 나은 요약본의 이름을 지어주세요. 훌륭한 요약본의 가장 중요한 자질은 영상에 고유한 핵심 메시지를 제시하는 것입니다. 설명은 필요하지 않습니다.", "{{[OUTPUT]}}"
여기에 제 발견 사항을 공유합니다. (1) 판단이 후자의 예시를 선호하도록 편향되어 있었습니다. 이를 상쇄하기 위해 후보들을 교체하여 또 다른 라운드의 비교를 추가했습니다. (2) 균형을 맞춘 후에도, 판단은 무작위가 아니며 유의미했습니다. 선택 전에 정당성을 부여하는 과정이 반드시 필요하지는 않습니다. 아마도 모든 쌍 비교(quadratic time)가 가장 좋은 것을 찾는 데 필수적이지 않을 것입니다. 예를 들어, 5개의 후보를 순위 매기고 그중 최고의 하나를 선택한 다음, 나머지 4개를 생성하여 다음 5개로 구성할 수 있습니다. 승패를 평가하기 위해 Bradley-Terry 모델을 기반으로 하는 최대 우도 추정(Maximum Likelihood Estimation, MLE)을 사용했습니다. 혹시 필요하신 분들을 위해 코드를 공유합니다: https://github.com/h2kyeong/scriptlets/blob/main/llm_multigen_league.py /u/SpecialNothingness 제출 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기