Jeff-Qwen3.5-0.8B v1.2와 9개 LoRA 어댑터: Qwen3.8-27B 앞에 배치하여 의사결정 속도를 38배 향상하고 정확도를
요약
작고 효율적인 시스템 1 모델인 Jeff-Qwen3.5-0.8B와 9개의 LoRA 어댑터를 결합하여, 대형 LLM(Qwen3.8-27B)의 느린 추론 과정을 대체하는 방법을 제시합니다. 이 조합은 의사결정 속도를 최대 38배 향상시키고 정확도 또한 크게 개선했습니다.
핵심 포인트
- Jeff + 어댑터는 Qwen3.8-27B 대비 의사결정 속도를 평균 38배 빠르게 합니다.
- LoRA 어댑터를 활용하여 특정 작업(분류, 도구 선택 등)에서 높은 정확도를 유지합니다.
- 기본 모델의 일반화 능력과 어댑터의 전문성을 결합하는 하이브리드 접근 방식입니다.
- 메모리 사용량 증가가 크지 않아 효율적인 배포가 가능합니다.
며칠 전, 저는 사용자가 정의한 옵션 사이에서 선택하고 각 옵션에 대해 보정된 확률을 단일 순전파(forward pass)로 반환하는 작은 '시스템 1' 모델인 Jeff-Qwen3.5-0.8B를 공개했습니다. M4 Max와 RTX PRO 6000에서는 속도가 매우 좋았지만, 일반적인 제로샷 분류기(zero-shot classifier)로서의 성능은 대형 모델에 미치지 못했습니다. 그러던 중, 에이전트가 로컬 모델 앞에서 내리는 대부분의 결정은 개방적이지 않다는 것을 깨달았습니다. 이들은 몇 가지 반복되는 종류의 범주에 속합니다: 이것이 프롬프트 주입(prompt injection)인지, 어떤 도구를 호출해야 하는지, 이 티켓이 얼마나 긴급한지, 이 답변이 출처에 근거하는지 등입니다. 그래서 저는 각 작업마다 9개의 LoRA 어댑터를 훈련시켰고, 사용자가 필요한 것을 선택할 수 있도록 했습니다. 서버는 기본 모델을 한 번만 로드하고, 사용자가 선택한 어댑터(각 약 40MB)를 추가합니다. 모든 요청은 어댑터 이름을 지정하거나 순수한 Jeff로 전송됩니다. 이는 두 가지를 모두 유지한다는 의미입니다: 기본 모델은 건드리지 않아 새로운 모든 것에 대한 Jeff의 일반적인 제로샷 능력을 계속 얻을 수 있고, 어댑터는 사용자가 신경 쓰는 영역에서 거의 완벽한 정확도를 제공합니다. 또한 각 어댑터는 기본 모델 자체의 훈련 데이터 중 10%가 혼합되어 함께 훈련되었기 때문에 일반적인 기술을 유지하는 데 도움이 됩니다. 모든 것은 jeffhub.ai에 있습니다: 어댑터, 결과, 문서입니다. 코드는 GitHub에, 모델은 Hugging Face에 있으며, 브라우저에서 아홉 개의 어댑터를 모두 시도해 볼 수 있습니다. 핵심 내용은 다음과 같습니다: 저는 Jeff + 어댑터가 먼저 답변하게 하고, 불확실한 쿼리만 Qwen3.8-27B로 전달하도록 했습니다. M4 Max에서 동일한 테스트 행으로 양방향 측정 결과입니다: Qwen3.8-27B 단독 사용 vs. Jeff + 어댑터 사용, 27B는 불확실할 때만 사용. 정확도 (8개 어댑터 평균*): 86.6% → 95.3%. 의사결정당 시간 평균: 8.1초 → 0.25초 (38배 빠름). 오답률: 13.4% → 4.7%. 메모리: Jeff는 모든 9개 어댑터를 로드해도 28.6GB로 2GB 미만 (+6.9%). 인박스 에이전트가 메시지 하나당 내리는 다섯 가지 결정(가드, 분류, 지원 의도, 도구 선택, 근거 마련)에 대해서는 단독 사용 시: 87.7% → 95.7%, 39배 빠름. Jeff가 9개 어댑터 중 8개에서 압도적으로 승리하고, 근거 마련(96.3% 대 96.7%)에서는 동률이지만 속도는 20배 빠릅니다.
완전히 분리된 테스트 세트에서 9개 어댑터 중 6개가 97–98%의 점수를 기록했습니다. GPU 환경에서 하나의 어댑터를 로드하든 아홉 개를 모두 로드하든 의사결정 시간은 약 30ms가 소요됩니다. *감정(Emotion) 분석은 평균에 포함되지 않았습니다: 짧은 Reddit 댓글에서 27가지 감정(또는 중립) 중 가장 강한 것을 고르는 것은 사람에게도 어렵고, 인간의 레이블링 결과가 종종 일치하지 않습니다. 이 경우 Jeff + 어댑터 조합이 60.6%를 기록하여 27B 모델의 35.6%보다 높았으며 속도는 42배 빨랐습니다. 감정 분석을 포함할 경우, 모든 9개 어댑터를 평균한 점수는 27B 모델의 80.9% 대비 Jeff + 어댑터 조합이 91.4%를 기록하므로, 이를 제외하는 것이 위에서 제시된 이득을 더 작게 만드는 것입니다. 미리 알려드립니다: 27B 모델은 8비트(8-bit)로 실행되었으며 단계별 추론(step-by-step reasoning) 기능이 꺼져 있었습니다 (추론 기능을 켜면 속도 향상은 훨씬 더 극적일 것입니다). 각 작업에는 300개의 고정된 분리된 행(emotion 및 법률 조항의 경우 500개)이 사용되었습니다. 또한, 각 어댑터의 '전달 임계값(pass it on)'은 테스트 행에 점수를 매기기 전에 별도의 보정 행(calibration rows)에서 선택되었습니다. 데이터: 4개의 어댑터는 공개 데이터 세트로 학습되었고, 5개는 주로 합성 데이터로 구성되었습니다. 생성된 모든 행에는 어떤 모델이 작성했는지 기록되어 있으며, 카드에는 그 개수가 표시됩니다. 모든 데이터 세트는 학습 전에 단축 검사(shortcut check)와 독립적인 검토를 거쳤으며, 많은 초안들이 실패했습니다: 예를 들어 답변이 길이만으로 유추되는 경우 등이 있었습니다. 공개된 정보: 가중치(weights)는 Apache 2.0 라이선스, 코드는 MIT 라이선스를 따르며, 각 어댑터의 테스트 및 보정 세트도 공개되어 있어 모든 수치를 확인할 수 있습니다. 학습 데이터 자체는 공개되지 않았습니다. https://jeffhub.ai : 모든 어댑터와 그 결과, 오류가 발생하는 지점, 사용된 데이터, QA 보고서, 그리고 Python 및 TypeScript 예시를 제공합니다. 코드: https://github.com/firelex/jeff 모델 및 어댑터: https://huggingface.co/mstrasser 브라우저에서 테스트해 보기: https://huggingface.co/spaces/mstrasser/Jeff-adapters-demo 27B 비교 재현하기: https://github.com/firelex/jeff-reference-app 이는 커뮤니티 프리뷰입니다: 피드백을 환영합니다. 다음으로: 향후 약 36시간 동안 장기 지원 기반인 v1.3을 학습시킬 예정입니다.
프롬프트의 고정된 부분은 먼저 오기 때문에 서버가 이를 한 번 준비하여 재사용할 수 있고, 이는 더 빠른 의사결정을 의미합니다. 저는 이후 이 모든 아답터에 대해 재훈련을 진행하고 요청 형식을 안정적으로 유지하여 다른 사람들이 자신만의 아답터를 구축하고 제출할 수 있도록 할 것입니다. 제가 사용한 데이터 검사를 포함한 아답터 키트는 레포지토리에 있습니다. 이제 더 많은 하드웨어에 접근할 수 있게 되었으니, 만약 어떤 의사결정에 대한 아답터가 필요하다면 알려주세요. 제가 훈련해 드리겠습니다. 목표는 다음과 같습니다: 다음 세대의 로컬 모델(모두가 기다리는 Qwen 4와 같은)이 출시될 때, 로컬에서 이를 실행하는 모든 사람이 그 앞에 작고 빠르며 잘 보정된 의사결정 레이어를 갖도록 하는 것입니다. /u/Usual_Maximum7673이 r/LocalLLaMA에 제출함 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기