JEV가 거의 죽었다: CLM 대 JEV
요약
CLM은 TypeSafe AI의 Jev에 대한 오픈 웨이트 대안으로, 동일한 핵심 기능을 지원하며 자체 호스팅이 가능합니다. CLM은 상태 헤드와 액션 헤드를 분리하여 에이전트 벤치마크에서 Jev보다 훨씬 빠른 지연 시간과 높은 성능을 보여줍니다. 다만, 제로샷 광범위 지식 영역에서는 여전히 Jev가 우위를 점하는 부분이 있습니다.
핵심 포인트
- CLM은 Jev의 기능을 지원하는 오픈 웨이트 대안입니다.
- 상태/액션 헤드 분리로 에이전트 벤치마크에서 속도가 빠릅니다.
- 사용자 미세 조정(fine-tuning)이 가능하여 커스터마이징에 유리합니다.
- 제로샷 광범위 지식에서는 Jev가 여전히 정확도 우위를 가집니다.
원문 게시물: https://www.reddit.com/r/LocalLLaMA/comments/1woscea/contrastive_language_models/ (CLM에게 마땅히 주어져야 할 주목을 받지 못한다고 느껴서 죄송합니다) 이것이 무엇인가요: Qwen3-8B를 위한 새로운 투영 헤드(projection head)입니다. github: https://github.com/Contrastive-LM/CLM hf: https://huggingface.co/Contrastive-LM API 및 기능 인터페이스 수준에서 CLM은 Jev가 하는 모든 것을 지원하며, 부분집합이 아닙니다. 하지만 두 모델 사이에는 일반화(generalization), 컨텍스트 스케일(context scale), 아키텍처 면에서 중요한 트레이드오프가 존재합니다.
- 기능적 동등성 (동일한 기본 원리): CLM은 TypeSafe AI의 Jev에 대한 오픈 웨이트(open-weights)이며 자체 호스팅이 가능한 대안으로 특별히 설계되었습니다. 이는 정확히 동일한 "System One" 의사 결정 인터페이스를 구현하며, Jev의 세 가지 핵심 질문 기본 원리(core question primitives)를 모두 지원합니다:
- Choice: 이산적인 후보군을 평가하고 범주형 확률 분포(categorical probability distribution)를 반환합니다.
- Noul: 명제 또는 가드레일 검사에 대해 보정된 참/거짓 확률(calibrated true/false probability)을 출력합니다.
- Score: 입력값을 순서화된 루브릭(rubric) 또는 척도에 따라 점수화합니다.
TypeSafe Jev 클라이언트를 위해 작성된 코드는 clm-serve 엔드포인트로 직접 연결할 수 있으며 드롭인 호환성(drop-in compatibility)을 가집니다 (from clm import CLMClient, Choice, Noul, Score).
- CLM이 Jev보다 우수한 부분: 지연 시간 및 분리된 캐싱: Jev는 상태와 질문 선택을 공동으로 평가하는 독점 클라우드 모델입니다. CLM은 상태 헤드(state head)를 액션 헤드(action head)로부터 분리합니다. 에이전트가 지속적인 도구 또는 행동 세트를 가지고 있다면, CLM은 해당 행동들을 한 번 임베딩하고 캐시합니다. 대화형 브라우저 에이전트 및 게임(T-Rex, Super Mario)과 같은 벤치마크에서 CLM은 Jev보다 4배에서 13배 빠릅니다.
오픈 웨이트 및 미세 조정 가능성: Jev는 사용자 미세 조정(user fine-tuning)이 불가능한 폐쇄형 API입니다 (상태와 질문 지침을 통해서만 프롬프트할 수 있습니다). 하지만 CLM의 헤드들은 매우 작은 오픈 웨이트(~75 MB)이기 때문에, 사용자가 자신의 에이전트 궤적(agent trajectories)으로 미세 조정할 수 있습니다.
코딩 벤치마크 검증기(Coding Benchmark Verifiers): 에이전트 궤적으로 미세 조정했을 때, CLM은 Terminal-Bench 2.1에서 (87.6%)와 DeepSWE에서 (81.6%) 최신 성능의 검증기 성능을 달성하는 반면, 제로샷(zero-shot) Jev는 해당 벤치마크에서 어려움을 겪었습니다 (DeepSWE에서 약 71% 점수). 3. Jev가 여전히 우위를 점하는 영역 (CLM-8B의 한계점): CLM이 Jev의 모든 기능 표면을 다루지만, 현재 CLM-v0.1-8B 버전은 몇 가지 영역에서 Jev에 뒤처집니다: 제로샷 광범위 지식(Zero-Shot Broad Knowledge): Jev는 더 크고 독점적인 모델의 지원을 받습니다. 제로샷 오픈 도메인 작업에서는 Jev가 여전히 엣지 케이스 정확도에서 우위를 점합니다 (예: Berkeley Function Calling Leaderboard v4: Jev는 99.2%를 기록한 반면, CLM-8B는 95.2%; WikiRacing: Jev는 30/30 대 CLM-8B의 26/30). 컨텍스트 예산(Context Budget): Jev는 별도의 설정 없이 최대 64K 토큰까지 요청을 수용합니다. CLM-8B는 2K에서 8K 컨텍스트로 테스트 및 보정되었습니다. Qwen3 백본은 더 긴 프롬프트를 수용할 수 있지만, 8K를 초과하는 표현은 참조 헤드(reference head)에 대해 보정되지 않았습니다. 확률 정규화(Probability Normalization): CLM은 요청에 포함된 후보군(candidates)에 대한 점곱(dot products) 및 소프트맥스(softmax)를 통해 확률을 계산합니다. 따라서 그 확률은 제공된 후보군에 본질적으로 상대적입니다. 반면, Jev의 점수는 절대적인 기준에 따라 내부적으로 보정됩니다. 요약: CLM을 사용하여 Jev 대신 API 기능을 잃게 될지 묻는다면: 아닙니다. 엄청난 지연 시간 감소와 제로 API 비용으로 전체 기본 기능 세트(Choice, Noul, Score)를 얻습니다. TypeSafe의 호스팅 서비스와 비교했을 때, 사용자가 포기하는 것은 니치한 아웃-오브-도메인 작업에서의 일부 제로샷 일반화 능력뿐입니다. submitted by /u/R_Duncan to r/LocalLLaMA [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기