PyroDash: 비용 효율적인 토큰 수준의 소형-대형 언어 모델 협업 추론
요약
PyroDash는 SLM과 LLM의 토큰 수준 협업을 통해 추론 비용을 절감하는 프레임워크입니다. SLM이 제어 토큰을 통해 LLM에 도움을 요청하는 방식으로 작동하며, 별도의 라우터 없이도 높은 정확도와 비용 효율성을 동시에 달성합니다.
핵심 포인트
- SLM-LLM 간 토큰 수준의 효율적인 핸드오프 메커니즘 제안
- 별도의 라우터나 LLM 재학습 없이 SLM 내부 정책으로 작동
- 비용과 정확도 사이의 균형을 맞추는 비용 인식 정렬 학습
- LLM 단독 사용 대비 비용을 대폭 절감하면서도 정확도 향상 가능
대형 언어 모델 (LLMs)은 강력한 추론 능력을 제공하지만 대규모로 서비스하기에는 비용이 많이 드는 반면, 소형 언어 모델 (SLMs)은 비용은 저렴하지만 어려운 문제에 대해서는 신뢰도가 낮습니다. 우리는 토큰 수준의 SLM-LLM 협업 추론을 위한 비용 인식 프레임워크인 PyroDash를 소개합니다. 생성 과정에서 SLM은 제어 토큰 (control token)을 방출하여 도움을 요청할지 여부를 결정합니다. 그러면 협업 엔진 (Collaborate Engine)이 쿼리와 부분적인 추론 흔적 (reasoning trace)을 단 한 번의 핸드오프 (handoff)를 통해 동결된 (frozen) LLM으로 보내 완성을 요청합니다. 이 정책은 SLM 내부에 내재화되어 있어, 별도의 라우터 (router), LLM 재학습, 또는 LLM 로짓 (logits)에 대한 접근이 필요하지 않습니다. PyroDash는 세 단계로 SLM을 학습시킵니다: 제어 토큰 임베딩 학습 (control-token embedding learning), 오프로딩 지향 지도 미세 조정 (offloading-oriented supervised fine-tuning), 그리고 그룹 상대 정책 최적화 (Group Relative Policy Optimization)를 통한 비용 인식 정렬 (cost-aware alignment)입니다. 이 보상 (reward)은 LLM 단독 추론 대비 정규화된 추론 비용과 정답 정확도 사이의 균형을 맞춥니다. 5개의 수학적 추론 벤치마크 전반에 걸쳐, PyroDash는 다양한 정확도-비용 운영 지점을 지원합니다. $λ=0.05$일 때, PyroDash는 LLM 단독 베이스라인보다 6.36 퍼센트 포인트 높은 64.04%의 평균 정확도를 달성하는 동시에 비용을 20.4% 절감합니다. $λ=0.6$일 때, PyroDash는 1.90%의 LLM 토큰 비율과 예시당 0.012회의 LLM 호출로 54.55%의 정확도를 달성하며, 총 비용을 USD 49.36에서 USD 1.78로 줄입니다. 이러한 결과는 학습된 토큰 수준의 핸드오프가 강력한 추론 성능을 유지하면서도 LLM 사용을 줄일 수 있음을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기