크래프톤, 21B 한영 이중언어 음성 AI 모델 'A.X K2 Raon-Speech' 공개
요약
크래프톤이 SKT의 텍MM 백본과 자체 개발한 음성 인코더 및 코덱을 결합한 21B 규모의 한영 이중언어 음성 AI 모델 'A.X K2 Raon-Speech'를 공개했습니다. 이 모델은 STT, TTS, 멀티모달 대화 등 다양한 음성 기능을 지원하며 한국어 성능에서 높은 벤치마크 점수를 기록했습니다.
핵심 포인트
- SKT의 A.X K2 Light 20B-A3B MoE 기반 21.2B 모델
- STT, TTS, SpeechQA 등 통합 멀티모달 기능 지원
- 30B 이하 모델 중 한국어 종합 1위 기록
- 음성 복제 및 운율을 유지하는 TTS continuation 지원
- 연구 및 비상업적 용도의 CC BY-NC 4.0 라이선스 적용
-
SKT의 A.X K2 Light 20B-A3B 텍스트 백본에 KRAFTON이 자체 학습한
음성 인코더와 음성 코덱을 결합한 모델로, 전체 21.2B 중 약 3.5B 파라미터를 활성화 -
Raon-Speech-9B의 학습 방식을 사용하며 세 가지 주요 구성 요소를 통합
-
텍스트 백본:
A.X K2 Light 20B-A3B MoE -
음성 인코더: KRAFTON이 독립적으로 학습한
AuT 인코더. Qwen3-ASR 아키텍처 기반(24개 레이어, 317M 파라미터) -
음성 생성 모듈: KRAFTON이 독립적으로 학습한
Mimi 계열 신경망 음성 코덱. 약 96M 파라미터 -
하나의 모델에서
STT/TTS, SpeechQA/SpokenQA, 텍스트 질의응답, 도구 호출, 턴 기반 멀티모달 대화를 지원하며 감정/억양/화자 정보도 응답 생성에 활용 -
텍스트 백본은 48개 레이어와 2,048 차원 은닉 상태를 사용하며, 128개 라우팅 전문가 중 토큰마다 상위 8개를 활성화하며, 최대
131,072 토큰 -
한국어 24개와 영어 22개 등 46개 벤치마크 평가에서 30B 이하 공개 음성 언어 모델 중
한국어 종합 1위 0.72, 영어 종합 3위 0.75를 기록 -
화자 참조 음성을 이용한 음성 복제와 참조 음성의 운율을 이어가는 TTS continuation을 지원하지만, BF16 가중치가 약
42.4GB로 80GB GPU 또는 적절한 다중 GPU 구성을 권장함 -
연구와 비상업적 프로토타이핑을 위한
CC BY-NC 4.0 모델로, 식별 가능한 화자의 음성을 조건으로 사용하거나 생성할 때 이용자가 동의를 확보해야 함 -
크래프톤은 과학기술정보통신부가 주관하는 ‘독자 AI 파운데이션 모델 프로젝트(독파모)' SK텔레콤 팀에 참여해 멀티모달모델 연구를 진행하고 있음
댓글과 토론
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기