
ai-sage/GigaChat3.1-Audio-10B-A1.8B · Hugging Face
요약
GigaChat 3.1 Lightning을 기반으로 구축된 오디오 네이티브 LLM인 GigaChat Audio 10B를 소개합니다. Conformer 음성 인코더와 MoE 디코더를 결합하여 텍스트 품질을 유지하면서도 뛰어난 음성 이해 능력을 갖추었습니다.
핵심 포인트
- Conformer 인코더와 MoE 디코더를 통한 오디오 임베딩 전달
- 오디오 질의응답, 분류, 도구 사용 및 텍스트 작업 지원
- TimeGround-1M 데이터셋을 활용한 정교한 시간적 접지(Temporal Grounding) 기술
- 긴 오디오 내 이벤트 위치 파악 및 타임스탬프 포함 요약 가능
GigaChat Audio 10B는 GigaChat 3.1 Lightning 텍스트 모델을 기반으로 구축된 오디오 네이티브 LLM (Large Language Model)입니다. Conformer 음성 인코더 (speech encoder)와 모달리티 어댑터 (modality adapter)가 오디오 임베딩 (audio embeddings)을 Mixture-of-Experts 디코더 (decoder)에 직접 전달하여, 모델이 베이스 모델의 텍스트 품질을 유지하면서 음성 이해 능력을 추가할 수 있도록 합니다. 주요 기능: 오디오 질의응답 (audio question answering) 및 분류 (classification), 시간적 접지 (temporal grounding; 긴 오디오 내 위치 파악, 타임스탬프가 포함된 이벤트 설명, 타임스탬프를 포함한 오디오 요약), 도구 사용 (tool-use), 그리고 텍스트 전용 작업입니다. 시간적 접지 기술은 시간 정렬된 주석 (time-aligned annotations)이 쌍을 이루는 긴 형식의 오디오를 위해 특별히 제작된 데이터셋인 TimeGround-1M을 통해 학습되었습니다. submitted by /u/pmttyji [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기