
WhatsApp 그룹 채팅으로 2B LLM을 파인튜닝한 경험과 GitHub 공유 방법
요약
본 글은 WhatsApp 그룹 채팅 데이터를 활용하여 2B 소형 로컬 LLM을 파인튜닝한 개인적인 경험과 그 결과를 공유합니다. 모델이 실제 대화의 재미와 유사성을 재현하는 데 초점을 맞추었으며, GitHub에 재현 가능한 파이프라인과 평가 방법을 공개했습니다.
핵심 포인트
- 그룹 채팅 데이터로 2B LLM을 파인튜닝하여 높은 시뮬레이션 재미를 경험함.
- 모델은 대화의 유사성은 높으나 깊은 이해도나 정보 유지 능력은 부족함.
- Judge LLM을 사용한 평가에서 최고 버전이 인간 대비 80% 승률을 기록했음.
- 재현 가능한 로컬 파이프라인과 평가 방법을 GitHub에 공개함.
https://github.com/Sayitobar/chat_llm_cookbook 이 프로젝트는 몇 달에 걸쳐 진행한 개인적인 작업입니다. M1 Pro에서 학습하고 실행한 6명 규모의 그룹 채팅을 2B 소형 로컬 모델로 얼마나 시뮬레이션할 수 있을지 보고 싶었습니다. 결과가 궁금하신가요?: - 재미있긴 하지만, 아주 뛰어나지는 않습니다. 일관성 있고 응집력 있는 그룹 시뮬레이션을 달성하지는 못했지만, 저희의 은어(slang), 반응, 대화 속도 등을 충분히 학습하여 재미를 느낄 수 있습니다. 생성된 메시지들이 우리가 실제로 타이핑하는 내용과 매우 유사합니다. - 어느 정도의 일관성은 있지만 깊은 이해도는 부족하며, 모델이 우리에 대한 정보(저희 이름이나 아주 명백한 몇 가지 사실 제외)를 유지하지는 못합니다. 논문 상으로는 얼마나 좋을까요?: - 저는 judge LLM을 사용하여 제 모델들의 성능을 평가했습니다. 가장 좋은 버전은 인간 대 모델 테스트에서 80%의 승률을 기록했는데, 이상적인 수치는 <50%입니다. 가장 중요한 것은, 이 모델을 여러분의 데이터로 학습시키면 채팅하는 재미가 매우 크다는 것입니다. (반드시 동의를 구해주세요) Cookbook: 재현 가능한 로컬 파이프라인, 채팅 UI, 인간 기반 평가(human-anchored evaluation), 결과 및 실험 PDF를 공개했습니다. 개인적인 채팅 데이터나 파인튜닝된 가중치(weights)는 공개하지 않습니다 :) 참고로, 제가 진행한 모든 테스트는 터키어로 이루어졌습니다. 이 프로젝트는 아직 미완성입니다. 제가 테스트하지 않은 아키텍처와 훈련 데이터 형식들이 남아있거나, 2026년 9월 기준으로 아직 출시되지 않은 더 강력한 2B 모델들이 있기 때문입니다. submitted by /u/BarisSayit [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기