32개의 로컬 모델을 대상으로 진행한 직접 비교 테스트 결과
요약
1,001개의 노트를 활용해 32개의 로컬 모델을 대상으로 사실 추출 성능을 직접 비교 테스트한 결과입니다. 대부분의 모델 간 성능 차이가 통계적으로 유의미하지 않았으나, LFM2.5 모델은 크기가 더 작은 모델들에게 성능이 뒤처지는 예외적인 결과를 보였습니다.
핵심 포인트
- 32개 로컬 모델 대상 사실 추출 성능 비교 테스트 수행
- 대부분의 모델 간 성능 차이는 통계적으로 유의미하지 않음
- LFM2.5 모델은 소규모 모델 대비 낮은 성능 기록
- Gemma-4-E2B 등 소형 모델의 높은 효율성 확인
저는 하나의 사실 추출 (fact-extraction) 코퍼스인 1,001개의 노트를 사용하여 32개의 로컬 모델을 대상으로 직접 비교 (head to head) 테스트를 수행했으며, 모든 인접 쌍에 대해 페어드 부트스트랩 (paired bootstrap)을 적용했습니다. 몇 주간의 연산 시간이 소요되었으며, 모두 소비자용 그래픽 카드 (consumer grade cards)로 진행되었습니다. 대부분의 분야에서는 차이가 나타나지 않았습니다. 2B에서 31B까지 6단계의 연속적인 과정에서 부트스트랩은 단 하나의 인접 쌍도 순위를 매기지 못했습니다. 상위 2개 모델 또한 서로 구분되지 않았습니다: 동일 계열의 35B MoE 모델과 27B 밀집 (dense) 모델 간의 차이는 -0.0106, 신뢰 구간 (CI)은 [-0.0294, +0.0088]이었습니다. LFM2.5가 예외였는데, 반대 방향의 결과가 나왔습니다. 이 모델은 이틀 전에 출시되었으나 크기가 훨씬 작은 모델들에게 패배했습니다. LFM2.5-8B-A1B는 0.5198을 기록했고 LFM2.5-2.6B는 0.5854를 기록한 반면, 2B 크기의 gemma-4-E2B는 0.6406을 기록했습니다. E2B의 가장 낮은 양자화 (quant) 모델조차 0.6017을 기록하며 위 두 모델보다 앞섰습니다. https://rakuensoftware.com/blog/local-llm-fact-extraction-head-to-head /u/KitchenAmoeba4438에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기