카카오, '카나나-2'의 경량 모델 4종 오픈소스로 공개
요약
카카오가 경량 모델인 'Kanana-2' SLM 4종을 오픈소스로 공개했습니다. 3B 및 1.3B 모델로 구성되며, 특히 1.3B 모델은 효율적인 어텐션 구조를 통해 긴 문맥을 지원하고 한국어 처리 효율을 대폭 높였습니다.
핵심 포인트
- 3B 및 1.3B 규모의 Base/Instruct 모델 4종 공개
- 1.3B 모델은 Sliding Window Attention으로 KV 캐시 사용량 72.7% 절감
- 새로운 한국어 토크나이저로 토큰화 효율 30% 이상 향상
- Qwen3 계열과 경쟁 가능한 수준의 한국어 성능 및 코드 생성 능력
- KananaOpenLicense를 통한 오픈소스 배포
Kanana-2 SLM 모델군으로3B 모델과 이를 압축한1.3B 모델의 Base/Instruct 가중치를 제공- Kanana-2-3B는 TPU 클러스터에서 처음부터 사전학습한 뒤 인스트럭션 파인튜닝과 강화학습을 적용했으며, 1.3B 모델은
단계적 가지치기와 증류로 3B 모델에서 파생 - 1.3B 모델은
Sliding Window Attention과 전체 어텐션을 3:1로 배치해 최대32,768 토큰을 지원하며, 32K 문맥에서 KV 캐시 사용량을 최대 약 72.7% 절감 - 새로운
한국어 토크나이저로 이전 세대보다 한국어 토큰화 효율을 30% 이상 높였으며, 1.3B Instruct는 제공된 비교에서 한국어 대화/지시 이행/도구 호출/코드 생성에서 Qwen3 계열과 경쟁하거나 앞서는 점수를 기록 - 사전학습과 사후학습에
카카오 사용자 데이터는 사용하지 않았으며, 가중치는 KananaOpenLicense로 배포 - 공개된 모델들
- Kanana-2-3B-Base: 30억 파라미터 사전학습 기반 모델
- Kanana-2-3B-Instruct: 인스트럭션 튜닝 30억 파라미터 모델
- Kanana-2-1.3B-Base: 압축된 13억 파라미터 기반 모델
- Kanana-2-1.3B-Instruct: 온디바이스 배포용 인스트럭션 튜닝 모델
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기