가장 작은 로컬 모델이 최고의 모델일 수도 있습니다 - 직접 측정한 4가지 모델 결과
요약
Ollama의 다양한 소형 로컬 모델들을 대상으로 산술, 구조화된 추출 등 다양한 작업 성능을 직접 비교 측정했습니다. 모델의 크기가 반드시 성능과 비례하지 않으며, 작업 유형에 따라 최적의 모델이 다름을 확인했습니다.
핵심 포인트
- 모델 크기와 성능은 반드시 정비례하지 않음
- deepseek-r1:1.5b는 산술 능력에서 압도적 성능을 보임
- 작업 유형(산술 vs 추출)에 따라 최적 모델이 달라짐
- 추론 모델 채점 시 <think> 블록 처리가 중요함
Ollama에 7개의 모델이 있었지만, 무엇을 어디에 사용해야 할지 전혀 몰랐습니다. 그래서 추측을 멈추고 직접 측정해 보았습니다.
16GB 노트북에서 152번의 생성(generations)을 수행했습니다. 탐욕적 디코딩 (Greedy decoding), 결정론적 채점 (deterministic grading) — 정확한 숫자, 정확한 문자열, JSON 필드, 정규 표현식 (regex)을 사용했습니다. LLM 판사 (LLM judge)를 사용하지 않았으므로, 감사해야 할 두 번째 모델의 편향 (bias)도 없습니다.
결과
모든 카테고리에서 승리한 모델은 없었습니다.
| 작업 유형 (task type) | deepseek-r1:1.5b (1.1 GB) | llama3.2:3b (2.0 GB) | gemma:2b | codellama 7b |
|---|---|---|---|---|
| 산술 (arithmetic) (12) | 10/12 | 2/12 | 2/12 | 3/12 |
| ... |
1.1 GB의 추론 (reasoning) 모델은 2 GB의 범용 모델보다 산술 능력이 5배 더 뛰어났지만, 구조화된 추출 (structured extraction) 능력은 절반에도 못 미쳤으며 지연 시간 (latency)은 9배 더 길었습니다. 제가 보유한 가장 작은 모델이 전체적으로 가장 높은 점수를 기록했습니다. 가장 큰 모델은 3위를 차지했습니다.
크기가 정확도를 예측하지는 않았습니다.
측정을 거의 망칠 뻔했던 한 가지
추론 (reasoning) 모델은 답변하기 전에 <think> 블록을 출력합니다. 저의 첫 번째 채점기(grader)는 전체 응답을 읽었기 때문에, 모델의 최종 답변 대신 중간 과정(working)을 계속 채점하여 정답을 오답으로 처리했습니다. 추론 블록을 제거하고 최종 답변에 고정(anchoring)하자 deepseek의 점수가 극적으로 변했습니다.
두 번째 버그: gemma는
원시 행(Raw rows)과 조건들이 저장소(repo)에 커밋되어 있으므로, 표를 신뢰하는 대신 채점 결과를 직접 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기