작은 모델로 큰 결정을 내리다: 144M 파라미터 타입 결정 모델을 구축하여 에이전트 결정의 82%를 LLM에서 분기 처리한 방법
요약
본 글은 에이전트 워크플로우에서 발생하는 높은 비용과 지연 시간을 해결하기 위해, 텍스트 생성 대신 타입 지정된 결정(yes/no, pick-one 등)을 출력하는 144.3M 파라미터의 경량 모델 'Phocinae-Largha-150M-v1'을 소개합니다. 이 모델은 단일 순방향 전달만으로 신뢰도와 함께 결정을 내리며, LLM 호출을 최대 82%까지 줄여 효율성을 극대화합니다.
핵심 포인트
- 결정(Decision)은 텍스트가 아닌 타입 지정된 출력이다.
- 144.3M 파라미터 모델로 에이전트 결정의 82%를 LLM 외부에서 처리한다.
- GPU 환경에서 결정당 p50 지연 시간이 18.6ms에 불과하다.
- 신뢰도 게이트($ au=0.6$)를 사용해 자신감 있는 결정만 로컬에서 처리하고 나머지는 에스컬레이션한다.
작은 모델, 큰 결정. — 144M 파라미터 타입 결정 모델을 구축하여 에이전트 결정의 82%를 LLMs에서 분기 처리한 방법
또는: 당신의 에이전트가 '이 명령어를 실행할까요?'라는 질문에 70B 채팅 모델이 필요하지 않은 이유.
제가 구축하는 모든 에이전트 워크플로우는 같은 벽에 부딪힙니다. 흥미로운 로직은 10줄에 불과한데, 나머지 90%가 언어 모델(language model)에게 '허용할지 거부할지?', '어떤 도구를 사용할지?', '통과시킬지 에스컬레이션 할지?'를 결정하게 하고, 이는 하루에도 수천 번씩 채팅 모델의 비용과 지연 시간으로 이루어집니다.
그래서 저는 챗봇의 반대편에 있는 것을 구축했습니다: Phocinae-Largha-150M-v1, 즉 144.3M 파라미터 타입 결정 모델입니다. 이 모델은 텍스트를 생성할 수 없습니다. 상태(state)와 타입이 지정된 질문 목록(yes/no, pick-one, 1-10 점수)을 입력받아, 단 한 번의 순방향 전달(forward pass)만으로 각 질문에 대한 판결과 보정된 신뢰도(calibrated confidence)를 반환합니다. GPU 사용 시 결정당 p50은 18.6 ms입니다. CPU 전용으로는 약 1.5초가 소요되며, GPU는 전혀 필요하지 않습니다. 오픈 소스이며 Apache-2.0 라이선스를 따릅니다.

아이디어: 결정은 텍스트가 아니다
결정(decision)이란 닫힌 옵션 집합(closed option set)에 대한 타입이 지정된 출력입니다:
state:
English typed-decisions: **0.797** (400 케이스 / 2,000 결정). 중국어(기계 번역 평가 세트, 네이티브 zh 학습 행 없음 — 공개): **0.789**. 동일 프로토콜 발표 점수: Laya 0.766 · JEV-27B 0.727 · meraGPT 0.768.
모델 카드에서 가장 많이 생략하는 지표를 저희가 공개합니다:
- **옵션 순서 변경률 (Option-order flip rate)**: 옵션을 섞었을 때 답변이 바뀌는가? 역순 0.0300 / 무작위 평균 0.0233 / 3개 중 아무거나 0.0433. 약 ~33회 재정렬당 한 번씩 답변이 변경됨.
- **보정(Calibration)**: 전송된 열 ECE 0.1313 — 숨기지 않고 그대로 공개함.
- **JevBench public-231**: 0.5108 (118/231) — 수용 기준인 58.4%보다 낮지만, 어쨌든 공개함. 평가 행으로 학습된 적 없음.
## 경제성: 대체재가 아닌 에스컬레이션 게이트(escalate gate)
작은 모델은 완벽할 필요는 없습니다 — 자신이 언제 그렇지 않은지 아는 것이 중요합니다. $ au=0.6$ 신뢰도 게이트를 사용하면, 자신감 있는 결정은 로컬에 머물고 나머지는 더 큰 모델로 에스컬레이션됩니다. 중국어 경로에서의 결과: LLM 호출이 **82% 감소** (100% → 18%)했으며, 결합 정확도는 **0.789에서 0.7948로 증가**했습니다 — 어려운 상위 18%를 라우팅함으로써 전체 시스템을 단순히 저렴하게 만드는 것이 아니라 약간 _더 좋게_ 만들었습니다.
[](https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fbs5lh4blf6e7vubr3o2a.gif)
제가 여러분께 남기고 싶은 틀은 이것입니다: **BERT의 시스템 1**. 에이전트를 위한 두 시스템 그림은
서버는 로컬 전용(127.0.0.1)이며, 런타임은 순수 PyTorch로 작동하고, 프로토콜(`/v1/systemone`: noul / choice / score questions, 보정된 확률)은 레포지토리에서 완전히 명시되어 있습니다. 또한 PreToolUse 승인 게이트가 실패 시 폐쇄(fails closed)되는 DeepSeek Harness 번들(dsh-phocinae, npm)도 있습니다.
## 솔직한 한계점 (모두가 건너뛰는 섹션 — 제발 그러지 마세요)
- 이것은 챗봇, 생성기 또는 장문 추론 모델이 아닙니다. 세계 지식 QA(World-knowledge QA)가 이 역할이 아닙니다.
- 중국어 행들은 기계 번역된 영어 사례이며, 네이티브 중국어 학습 데이터는 없습니다.
- 입력이 길어지면 성능이 저하됩니다: 16k/32k 프로브 점수는 각각 0.453 / 0.387입니다.
- JevBench 게이트를 통과하지 못했습니다 (그래서 카드에 숫자가 적혀 있습니다).
- 아직 인구통계학적/공정성 평가는 진행되지 않았습니다.
## 시도, 검증, 재현
- 레포지토리 (Apache-2.0, 전체 문서 + 27가지 시나리오 데모): [Phocinae/Phocinae-Largha-150M-v1](https://github.com/Phocinae/Phocinae-Largha-150M-v1)
- 가중치: [Hugging Face](https://huggingface.co/Phocinae/Phocinae-Largha-150M-v1) · [ModelScope](https://modelscope.cn/models/PerryLink/Phocinae-Largha-150M-v1)
- 재현: 시드(seeds), 행 세트 해시, 환경 및 평가 스크립트는 레포지토리에 포함되어 있어 — 게시된 모든 숫자는 재도출이 가능합니다.
만약 반복적인 결정이 주를 이루는 사용 사례가 있다면, 무엇부터 문제가 될지 듣고 싶습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기