CLM: 대조 학습으로 훈련된 의사 결정 모델, 또 다른 채팅 모델이 아닙니다
요약
본 기사는 기존 LLM의 '생성(generation)' 방식 대신, 에이전트의 핵심 문제인 '결정 지연 시간'을 해결하는 CLM(Contrastive Language Models)을 소개합니다. CLM은 상태와 행동 쌍을 직접 점수화하는 대조적 목적 함수로 훈련되어, 일반 LLM보다 훨씬 빠르고 저렴하게 의사 결정을 수행할 수 있습니다.
핵심 포인트
- CLM은 생성 대신 '상태-행동' 점수화를 통해 결정 과정을 분리합니다.
- 일반 LLM 대비 최대 9배 낮은 지연 시간과 비용 효율성을 제공합니다.
- 이 모델은 대화나 콘텐츠 생성이 아닌, 순수한 의사 결정 구성 요소입니다.
오늘날의 모델 경쟁은 주로 생성(generation)에 관한 것입니다. 더 긴 컨텍스트, 더 예쁜 답변, 더 강력한 추론 능력 등이 핵심입니다.
하지만 실제로 에이전트(agent)를 구동해 보면, 문제가 되는 것은 보통 '생성 능력이 떨어진다'가 아니라 **'결정하는 속도가 너무 느리다'**는 것입니다.
에이전트가 취하는 모든 단계에는 다음 행동을 선택해야 하는 과정이 필요합니다. 만약 이 선택 과정마저 전체 토큰별 생성 파이프라인(token-by-token generation pipeline)을 거친다면, 지연 시간(latency)과 비용이 모두 상승하게 됩니다. 단 하나의 '어떤 버튼'을 고르는 것만으로도 수백 개의 토큰을 소모할 수 있습니다.
CLM (Contrastive Language Models, 2913 stars, Apache-2.0, Python)은 이 문제를 다른 각도에서 접근합니다: 의사 결정 과정을 분리하여 전용 모델을 훈련시키는 것입니다. 핵심은 다음과 같습니다: 상태(state)와 행동(action)을 직접 연결하는 대조적 목적 함수(contrastive objective)로 훈련된 시스템 원(System One) 모델입니다.
일반 LLM과의 차이점
일반적인 LLM은 _생성적(generative)_입니다: 주어진 상태를 바탕으로 행동 토큰을 하나씩 작성합니다.
CLM은 _대조적(contrastive)_입니다: 학습하는 것은 '어떻게 쓸지'가 아니라 '이 상태에 어떤 행동이 더 적합한지'—즉, 상태-행동 쌍(state–action pairs)을 직접 점수화(scoring)하는 것입니다.
실질적인 이점은 다음과 같습니다:
- 빠름: 결정 과정 자체가 토큰 생성이 아니라 하나의 점수 계산(scoring pass)입니다. 저자들은 Jev와 동등한 성능을 보이면서도 최대 9배 낮은 지연 시간의 성능을 보고했습니다;
- 랭킹에 적합함: 대조적 목적 함수는 말 그대로 '올바른 것을 먼저 놓기'를 의미하며, 이는 후보 행동(candidate actions) 중에서 선택해야 하는 상황에 정확히 필요한 것입니다;
- 저렴함: 결정당 토큰 소모가 없습니다.
이 모델은 TypeSafe와 호환되는 API 뒤에서 CLM-8B를 제공하며 (이는 이 종류의 의사 결정 모델을 위한 사실상의 인터페이스입니다), 추가로 파인튜닝 튜토리얼과 Hugging Face에 모델/데이터를 공개했습니다.
주목할 만한 세 가지 신호탄
- 실제 에이전트의 고충, 즉 의사 결정 비용을 목표로 합니다. 에이전트를 사용해 본 사람이라면 누구나 "매 단계마다 모델이 생각하는 것을 기다리는 것"이 가장 큰 사용자 경험(UX) 저해 요소라는 것을 알고 있습니다. 전용 8B 의사 결정 모델(모든 선택에 100B 이상의 모델에 의존하는 대신)은 지연 시간(latency)과 비용 측면에서 한 자릿수(order-of-magnitude)의 변화를 가져옵니다.
- "대조 학습 (Contrastive learning) + 상태/행동 (state/action)"은 실제 이론적 근거를 가지고 있습니다. 이 모델은 큰 모델을 축소하는 것이 아니라, 학습 목표 자체를 _생성(generation)_에서 _대조(contrast)_로 변경합니다. 이는 단순히 컴퓨팅 파워를 쏟아붓는 것이 아니라 문제를 올바르게 정의하는 것입니다.
- 엔지니어링 구현이 비정상적으로 완벽합니다. PyPI 패키지(
pip install contrastive-lm), 원클릭clm-serve, 미세 조정(fine-tuning) 튜토리얼, 그리고 HF 모델까지 갖추고 있습니다. 단순히 논문을 발표하는 저장소가 아니라, 실제로 구동되도록 설계되었습니다.
솔직한 주의사항 (The honest caveat)
이는 일반적인 비서 역할이 아닌 의사 결정 구성 요소입니다. CLM은 "이 후보들 중 어느 것"에 답할 뿐이며, 대화하거나 콘텐츠를 생성하지 않습니다. 사용자는 이해력과 표현력을 제공하는 주 모델(해당 저장소는 인코더로 Qwen3-8B를 사용함)과 CLM을 결합하여, CLM이 빠르고 정확하게 점수 매기고 순위를 매기도록 합니다.
또한 매우 새롭고 (규모가 커지면서 몇 주밖에 되지 않았으며), 의존성 체인(dependency chain)도 간단하지 않습니다: vLLM이 인코더를 서비스하고 + CLM 서비스 + 클라이언트가 필요합니다. 실제 설정 과정에서 어려움을 겪을 수 있습니다.
저는 README 문서를 중국어로 현지화했으며, 사용자가 전체 영어 문서를 먼저 읽을 필요가 없도록 상단에 "中文快速上手"(중국어 빠른 시작) 섹션을 추가했습니다. 이 섹션에는 실제로 무엇을 해결하는지, 가장 짧은 실행 경로, 환경 요구 사항 및 일반적인 함정들이 담겨 있습니다: [https://github.com/yangshun2005/CLM-cn]
이 프로젝트가 유용하다고 생각되시면, 원본 저장소에 별점을 남겨주시는 것이 저자에게 지속적인 유지 보수 지원이 됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기