
GigaChat Audio, 감정을 인식하고 3시간 분량의 녹음에서 필요한 순간을 찾는 법: gigachat open source
요약
Sber가 감정 인식과 긴 오디오 처리가 가능한 GigaChat Audio 업데이트 및 경량 오픈 소스 모델(GigaChat3.1-Audio-10B)을 공개했습니다. 이 모델은 텍text 전사 과정 없이 음성을 직접 처리하며, 최대 3시간 분량의 녹음에서 타임코드와 함께 답변을 제공합니다.
핵심 포인트
- 텍스트 전사 없이 음성 파일을 직접 처리하여 효율성 증대
- 억양과 목소리를 통한 긍정적/부정적 감정 인식 기능
- 최대 3시간 분량의 오디오에서 타임코드 기반 답변 제공
- GigaChat3.1-Audio-10B 경량 모델 오픈 소스 공개
- 다양한 중앙아시아 언어를 지원하는 GigaAM Multilingual 공개
2026년 7월 14일, Sber는 자사의 AI 어시스턴트 내 오디오 모델을 업데이트하고 개발자를 위한 경량 버전을 공개했습니다. 실질적으로 변화된 주요 사항은 다음과 같습니다: 모델이 전체 녹음 내용을 텍스트로 사전 전사(Transcription)하는 필수 과정 없이 음성과 오디오 파일을 직접 처리하며, 말의 긍정적 또는 부정적 감정 색채를 포착하고, 최대 3시간 길이의 녹음에서 타임코드(Timecode) 링크와 함께 답변할 수 있다는 점입니다. 이는 2026년 7월 14일 Sber의 발표와 CNews 및 Компьютерра의 분석 내용을 바탕으로 한 데이터입니다.
쉽게 말해, 이제 회의 전체를 별도의 전사 도구에 넣고 수동으로 되감으며 확인할 필요가 없습니다. "예산에 관한 부분은 어디로 갔지?"라고 물으면 특정 타임코드를 지칭하는 답변을 받을 수 있습니다. 이미 프로덕션(Prod) 환경에서 음성 시나리오를 운영 중이라면, 이미 완성된 전사본(Transcript)을 다른 LLM(Large Language Model)들이 어떻게 분석하는지 비교하기 위해 다른 모델들을 곁에 두는 것이 편리합니다. provod.ai (러시아의 OpenRouter)는 다양한 LLM에 대한 단일 API를 제공하는 서비스입니다. GigaChat Audio 자체는 포함되어 있지 않지만, 다섯 개의 서로 다른 구독을 생성하지 않고도 자신의 데이터를 사용하여 여러 모델에서 GigaChat Audio의 전사본을 검증할 수 있습니다.
7월 14일에 정확히 무슨 일이 일어났나
Sber의 발표에 따르면, 업데이트된 GigaChat Audio는 AI 어시스턴트에 도입되었으며, 경량화된 GigaChat3.1-Audio-10B가 오픈 소스로 공개되었습니다. 또한 긴 오디오 녹음에서 답변의 시간적 연결(Temporal binding)을 설명하는 연구 논문(arXiv, 2026년 7월 11일)이 별도로 발표되었습니다.
제공된 패키지의 출처를 통해 확인된 사실들을 요약하면 다음과 같습니다:
- 모델은 전체 녹음을 텍스트로 변환하는 필수 과정 없이 음성 메시지와 오디오 파일을 직접 처리합니다;
- 억양, 목소리, 발음을 통해 말의 긍정적 또는 부정적 색채를 식별합니다;
- 제품 버전은 최대 3시간 분량의 녹음물을 처리하며, 화자를 구분하고, 요약(Summary)을 생성하며, 타임코드(Timecode) 링크와 함께 답변을 제공합니다;
- 이와 함께 Sber는 러시아어, 영어, 키르기스어, 카자흐어, 우즈베크어를 지원하는 음성 인식 모델 제품군인 GigaAM Multilingual을 공개했습니다.
여기서 마케팅과 검증 가능한 사실을 즉시 구분하는 것이 중요합니다. Sber는 새로운 기능들을 적극적으로 광고하고 있지만, 두 가지 핵심 수치는 내부적인 것입니다. 내부 테스트인 Arena Hard Audio에서 GigaChat Audio는 75%의 승률을 기록했으며, 주장된 감정 인식 정확도는 80%입니다. 이는 Sber 자체의 측정치이며 독립적인 감사(Audit)가 아니므로, 이를 외부 검증 결과인 것처럼 제시해서는 안 됩니다.
자신과 고객을 기만하지 않기 위해 기억해야 할 또 다른 미묘한 차이점은 다음과 같습니다. 학술 논문은 약 2시간의 윈도우(Window)를 가진 연구 모드를 설명하고 있는 반면, 제품 버전은 3시간으로 명시되어 있습니다. 이것이 실험과 제품을 가르는 경계선이며, 이 수치들을 혼동해서는 안 됩니다.
오픈 소스(Open Source)로 공개된 내용과 활용 방법
오픈 소스 부분은 바로 많은 이들이 gigachat open source 요청을 통해 찾는 핵심입니다. 실용적인 측면에서 두 가지 결과물이 있습니다: 로컬에서 실행하고 미세 조정(Fine-tuning)할 수 있는 경량화된 GigaChat3.1-Audio-10B와 5개 언어 음성 인식을 위한 GigaAM Multilingual입니다. CNews와 Kompyuterra의 데이터에 따르면, 두 모델 모두 Sber에 의해 2026년 7월 14일에 공개되었습니다.
Sber의 데이터에 따르면, 오픈 모델은 추가 언어를 학습시킬 수 있으며 전사(Transcription), 음성 번역기, 통화 분석 및 회의 내비게이션에 적용할 수 있습니다. 즉, 인터페이스에서 완성된 버튼이 나오기를 기다리는 것이 아니라, 기본 파이프라인(Pipeline)을 직접 구축하는 방식입니다. 이는 투입되는 노동력을 평가할 때 근본적으로 중요한 부분입니다. 오픈 웨이트(Open weights)는 종착점이 아니라 시작점입니다.
최소한의 시작은 평범해 보입니다. 환경을 준비하고, 가중치 (weights) 로드에 대한 진실의 원천(source of truth)으로 모델 카드를 참조하는 것입니다. 정확한 리포지토리 (repository) 이름, 입력 형식, 하드웨어 요구 사항은 반드시 그곳에서 확인하십시오. 소스 팩 (source pack)에는 이러한 세부 정보가 포함되어 있지 않으며, 사용자가 벤더를 대신해 이를 임의로 만들어낼 필요도 없습니다.
# 2026년 7월 14일 Sber가 발표한 경량화된 오픈 모델
# GigaChat3.1-Audio-10B: 파인튜닝 (fine-tuning) 및 로컬 실행 가능
pip install transformers torch
...
그다음 로직은 다음과 같습니다: 오디오를 입력받아 화자 분리 (diarization), 감정 레이블링 (emotion labeling), 요약 (summary) 및 타임코드 (timecodes)를 출력합니다. 마법 같은 일은 없지만, 이제 반드시 전체 내용을 텍스트로 변환할 필요도 없습니다. 아래는 무엇이 오픈 소스로 공개되었고, 무엇이 제품 내부에 남아있는지에 대한 내용입니다.

75%와 80%라는 수치를 주의해서 받아들여야 하는 이유
숫자는 아름답게 들리며, 발표 자료에서 인용될 것입니다. 하지만 이 수치들이 어디에서 왔는지 솔직하게 분석해 봅시다. Arena Hard Audio에서의 75% 승률과 80%의 감정 인식 정확도는 2026년 7월 14일 출시와 함께 발표된 Sber의 내부 측정값입니다. 확인 시점(2026년 7월 14일) 기준으로 그 어떤 외부 벤치마크 (benchmark) 도 이 수치들을 확인해주지 않았습니다.
이것이 수치가 과장되었다는 뜻은 아닙니다. 다만 당신에게 독립적인 기준점이 없으며, 이 수치들을 최종적인 진실로 신뢰하기에는 이르다는 것을 의미합니다. 내부 테스트는 벤더가 직접 선택한 데이터와 환경에서 모델을 측정합니다. 잡음이 섞인 소리, 대화 끼어들기, 지역적 억양이 포함된 음성 시나리오의 경우, 실제 정확도는 양방향으로 차이가 날 수 있습니다. 따라서 유일하게 합리적인 접근 방식은 타인의 수치가 아닌, 자신의 녹음 데이터로 모델을 실행해보고 직접 퍼센트를 확인하는 것입니다.
이 모델에서 감정은 의미론적으로 이진적(binary)이라는 점을 별도로 염두에 두어야 합니다. 즉, 긍정적(positive) 또는 부정적(negative) 색채로 나뉩니다. 이는 거친 수준의 내비게이션(
회의 내비게이션(Navigation)은 세 번째 주요 시나리오입니다. 화자 분리(Speaker Diarization)에 요약(Summary), 그리고 타임스탬프(Timestamp)가 포함된 답변이 더해지면, 한 시간 분량의 회의 녹음은 마치 목차처럼 탐색할 수 있는 구조로 변합니다. 여기서 도구들을 솔직하게 비교하는 것이 더 유용합니다. GigaChat Audio는 러시아어 환경에 최적화된 Sber의 모델입니다. 만약 전사(Transcription) 후에 요약 및 분석을 위해 Claude, GPT, Gemini, DeepSeek 또는 Qwen을 거쳐야 한다면, VPN 없이 루블 결제 카드로 하나의 API를 통해 이를 수행할 수 있습니다. 개인 데이터가 포함된 시나리오의 경우, provod.ai는 152-FZ 법률에 따른 업무 프로세스를 위해 보호된 러시아 내 환경을 제공합니다. 구체적인 데이터 처리 방식은 각자의 케이스에 맞춰 문서와 계약서를 확인해야 합니다. 강조하자면, provod.ai는 GigaChat 자체에 대한 접근을 제공하는 것이 아니며, 이 둘은 서로 다른 것이므로 혼동해서는 안 됩니다.
from openai import OpenAI
client = OpenAI(api_key="ВАШ_КЛЮЧ", base_url="https://api.provod.ai/v1")
# 여기에 오디오 모델로부터 이미 완성된 전사(Transcript) 데이터가 들어옵니다.
...
중요한 실무적 뉘앙스: 학술 논문에 나온 연구 모드의 2시간과 Sber의 공지에서 나온 제품 모드의 3시간은 서로 다른 출처에서 나온 다른 수치입니다. 긴 녹음의 처리를 계획할 때는, 자체 환경에서 구동하는 오픈 소스 10B 모델이 아닌 제품 버전(Product version)을 사용하는 경우에만 제품 모드의 3시간을 기준으로 삼으십시오.

비용 및 리스크 측면에서 고려해야 할 사항
오픈 모델(Open model)은 공짜 점심이 아닙니다. 하드웨어와 엔지니어 비용을 지불해야 하며, 자신의 언어와 도메인에 맞춰 미세 조정(Fine-tuning)을 수행하고 인프라를 유지해야 합니다. AI 어시스턴트의 제품 버전(Product version)은 이러한 고통의 일부를 덜어주지만, 서비스의 틀 안에 갇히게 됩니다. 즉, 구독 서비스나 인터페이스를 통해서만 사용 가능한 기능은 로컬 환경에서 원본과 똑같이 재현할 수 없습니다. 오픈 10B 모델과 제품 사이의 선택은 "무료"와 "유료" 사이의 선택이 아니라, "제어권(Control)"과 "편의성(Convenience)" 사이의 선택입니다.
보안에 대해 별도로 언급하자면, 음성 합성(Synthesis)과 클로닝(Cloning) 기술이 저렴해지고 있으며, 이는 모든 음성 기술 진화의 이면이기도 합니다. GigaChat Audio는 억양을 듣고 말의 색채를 레이블링(Labeling)하지만, 그 자체로 가짜를 탐지하는 탐지기(Detector)이거나 본인 인증을 대체할 수 있는 것은 아닙니다. 소스 팩(Source pack)에는 모델이 가짜 목소리를 감지한다는 명시가 없으므로, 이를 방어 아키텍처의 핵심 요소로 간주해서는 안 됩니다.
도구들을 비교할 때는 다음과 같은 표를 곁에 두는 것이 가장 정직합니다. 대시(-)나 "명시되지 않음"으로 표시된 부분은 벤더(Vendor)가 구체적인 약속을 하지 않은 것이며, 이를 임의로 추측하여 채워 넣을 필요가 없습니다.
| 시나리오 | GigaChat Audio (제품) | 오픈 10B | 직접 구축할 경우 |
|---|---|---|---|
| 콜 분석, 아웃바운드 콜 | 최대 3시간, 감정, 화자 | 도메인 맞춤 미세 조정 | 저장 및 액세스 |
| ... |
표를 통해 알 수 있듯이, 오픈 모델과 제품 버전은 과제의 서로 다른 부분을 해결하며, 저장, 통합, 보안과 같은 상당한 양의 작업은 여전히 사용자의 몫으로 남습니다. 아래는 단 하나의 마법 같은 버튼이 존재한다는 환상을 깨기 위해, 파일로부터 타임코드(Timecode)가 포함된 응답에 이르기까지의 파이프라인(Pipeline)이 어떻게 구성되는지 보여줍니다.

이것이 해결하지 못하는 것
이것이 해결하지 못하는 것
이 모델은 당신의 생각을 읽거나 비즈니스 맥락을 대신 이해해주지는 않습니다. 모델은 무례함을 포함한 언어의 어조(tone)를 레이블링(labeling)하겠지만, 우선순위를 정하고 결론을 내리는 것은 여전히 당신의 몫입니다. 전사(transcription) 데이터 내의 개인정보는 직접 가려야 합니다. 민감한 부분을 마스킹(masking)하는 것은 서비스의 내장된 보장 기능이 아니라 사용자의 과제입니다.
80%의 감정 인식 정확도와 Arena Hard Audio에서의 75% 승률은 2026년 7월 중순 기준 Sber의 내부 수치입니다. 아직 독립적인 검증이 이루어지지 않았으므로, 이를 최종적인 진실이 아닌 참고 지표로 간주하십시오. 다시 한번 말씀드리자면, 연구 모드(research mode)의 2시간과 프로덕션 모드(production mode)의 3시간은 각각 arXiv와 Sber의 발표라는 서로 다른 출처에서 나온 별개의 정보입니다.
마지막으로, 이것은 인식 및 탐색을 위한 도구이지 업무 자체를 대체하는 것이 아닙니다. 모델이 당신을 대신해 통합(integration)을 구축하거나, 자동화 플랫폼을 대체하거나, 요구 사항에 따라 프라이빗(private) 또는 온프레미스(on-prem) 인프라가 필요한 곳을 없애주지는 않습니다. 모델은 목소리를 듣지만, 결정은 당신이 내립니다.
자주 묻는 질문 (FAQ)
GigaChat은 완전히 오픈 소스인가요?
아니요. 공개적으로 제공되는 것은 경량화된 GigaChat3.1-Audio-10B와 GigaAM Multilingual 제품군입니다. 완전한 프로덕션용 GigaChat Audio는 AI 어시스턴트 내에 존재합니다. 'gigachat open source'라는 검색어는 제품 전체가 아닌 이 두 모델을 더 정확하게 설명합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기