
4B 모델 분류 작업에서의 60-82% 정확도 변동: 유일한 변수는 하네스 (harness) 설계였다
요약
4B 모델을 활용한 분류 작업에서 하네스(harness) 설계 방식에 따라 정확도가 60%에서 82%까지 큰 차이를 보임을 입증했습니다. 프롬프트 내 규칙 배치와 참조 자료 순서 등이 성능에 결정적인 영향을 미친다는 연구 결과를 공유합니다.
핵심 포인트
- 하네스 설계 방식에 따라 모델 정확도가 최대 22%p 변동함
- 프롬프트 내 명시적 규칙 배치가 정확도 향상에 가장 큰 기여(+13)
- 추가적인 추론 턴이나 컨텍스트 요약 방식은 오히려 성능 저하 유발
- 모델의 성능 저하가 모델 자체의 한계가 아닌 하네스 설계 문제일 수 있음
저는 6GB 노트북 GPU를 사용하여 4B 모델로 분류 작업(Kubernetes 이슈 → SIG 분류)에 대한 사전 등록된 절제 연구 (ablation)를 수행했습니다. 모든 실행에서 동일한 고정된 가중치 (frozen weights), 동일한 250개 이슈의 골드 코퍼스 (gold corpus), 동일한 스코어러 (scorer)를 사용했습니다. 테스트된 변수는 하네스 (harness) 설계였습니다: 규칙 배치, 근거 순서, 턴 구조, 턴 사이에 무엇이 유지되는가 하는 점들입니다. 결과: 동일한 모델, 동일한 작업임에도 정확도가 22포인트 차이 났습니다. 최악의 하네스에서는 60%, 최선의 하네스에서는 82%를 기록했습니다. "이 모델은 X에 취약하다"라는 말은 실제로는 "내 하네스가 X에 취약하다"인 경우가 많습니다. 정확도를 변화시킨 요인들:
- 프롬프트 내 명시적 규칙 (Explicit rules): +13
- 참조 자료 앞의 작업 배치 (참조 자료 뒤가 아닌): +6.5
- 추가적인 추론 턴 (reasoning turn) 하나: -5
- 매 턴 컨텍스트를 비우고, 가공되지 않은 근거 대신 요약본을 전달하는 방식: -12
- 단계 간의 새로운 세션 인계 (Fresh-session handoff): -15
가장 설계가 잘못된 하네스는 추가 단계와 250번의 도구 호출 (tool calls)을 수행하고도 아무런 이득을 얻지 못했습니다. 결과적으로 모델 자체의 기본 정확도로 바로 돌아갔습니다. 코퍼스, 스코어러, 사전 등록, 모든 실행 매니페스트 (manifest) 등 모든 것은 공개되어 있으며 아카이브되어 있습니다. GPU 없이도 결과를 다시 점수 매길 수 있습니다. 새로운 예측을 생성할 때만 GPU가 필요합니다.
평가 하네스 (Eval harness): https://github.com/TGPSKI/leather/blob/main/examples/14-sig-triage/eval/README.md
예시 개요: https://github.com/TGPSKI/leather/tree/main/examples/14-sig-triage
매트릭스 결과: https://github.com/TGPSKI/leather/blob/main/examples/14-sig-triage/eval/results/MATRIX.md
submitted by /u/TGPSKI [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기