
Kwaipilot/KAT-Coder-V2.5-Dev · Hugging Face
요약
kwaipilot가 MoE 구조를 채택한 오픈 웨이트 모델 KAT-Coder-V2.5-Dev를 출시했습니다. SFT와 RL 학습을 통해 에이전틱 코딩 분야에서 SOTA 성능을 달성했으며, 도구 레이블 오류 및 반복 동작을 크게 개선했습니다.
핵심 포인트
- 총 35B, 활성화 3B 파라미터의 MoE 모델
- 에이전틱 코딩 분야에서 유사 규모 모델 중 SOTA 달성
- RL 학습을 통해 비정상적 도구 레이블 오류 대폭 감소
- 단일 턴 연속 반복 동작 문제를 0%로 최적화
kwaipilot: 지난 7월 KAT-Coder-V2.5를 출시한 데 이어, 커뮤니티와의 소통을 강화하고 우리의 연구 성과를 보여드리기 위해 총 파라미터 수 35B, 활성화 파라미터 수 3B인 MoE (Mixture of Experts) 모델인 오픈 웨이트 (open-weight) 버전 KAT-Coder-V2.5-Dev를 출시하게 되어 기쁩니다. KAT-Coder-V2.5-Dev의 주요 특징은 다음과 같습니다. 성능 향상: SFT (Supervised Fine-Tuning) / RL (Reinforcement Learning) 학습을 통해, KAT-Coder-V2.5-Dev는 유사한 파라미터 규모를 가진 모델들 사이에서 에이전틱 코딩 (Agentic Coding) 분야의 SOTA (State-of-the-Art) 결과를 달성했습니다. 비정상적 동작 최적화: RL (Reinforcement Learning) 학습을 통해 다음과 같은 특정 비정상적 동작들이 크게 최적화되었습니다: 비정상적인 도구 레이블 (abnormal tool labels) -9pp (9.34% -> 0.28%), 단일 턴 연속 반복 (single-turn continuous repetition) -0.34pp (0.34% -> 0%). submitted by /u/jacek2023 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기