
GigaChat Audio: 48.3 mIoU로 2시간 분량의 오디오에서 시간적 접지(Temporal grounding) 수행
요약
GigaChat Audio는 GigaAM 인코더와 10B MoE 디코더를 결합한 오픈 소스 오디오 LLM입니다. 2시간 분량의 오디오에서 48.3 mIoU의 성능으로 시간적 접지(Temporal grounding)를 수행할 수 있습니다.
핵심 포인트
- GigaAM 인코더와 10B MoE 디코더 결합
- ASR, 번역, QA, 감정 인식 등 다양한 기능 지원
- 2시간 분량 오디오에 대한 높은 시간적 지역화 성능
- MIT 라이선스의 오픈 소스 모델
GigaChat Audio: 48.3 mIoU로 2시간 분량의 오디오에서 시간적 접지(Temporal grounding) 수행
GigaAM 인코더(encoder)와 10B MoE 디코더(decoder) (1.8B 활성 파라미터)를 결합한 오픈 소스 오디오 LLM입니다. ASR(자동 음성 인식), 번역, QA(질의응답), 감정 인식(emotion recognition) 및 시간적 지역화(temporal localization)를 지원합니다. MIT 라이선스입니다. https://t.co/bGz36HmKMJ
AI 자동 생성 콘텐츠
본 콘텐츠는 X @huggingpapers (검증됨)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기