
«ChatGPT 카자흐어» 음성: Inkling - 네이티브 오디오를 지원하는 최초의 open-weight 모델
요약
Thinking Machines가 출시한 Inkling은 외부 인코더 없이 텍스트, 이미지, 오디오를 직접 처리하는 최초의 open-weight 멀티모달 모델입니다. 9750억 개의 파라미터를 보유하며, 오디오를 네이티브하게 이해하는 encoder-free early fusion 아키텍처를 채택했습니다.
핵심 포인트
- 외부 인코더 없이 오디오를 직접 처리하는 encoder-free early fusion 방식 적용
- Apache 2.0 라이선스로 가중치 공개 및 Hugging Face 배포
- AudioMC 벤치마크에서 경쟁 모델 대비 압도적인 성능 기록
- 음성 이해는 가능하나 출력은 텍스트로만 제한됨
2026년 7월 15일, OpenAI의 전 CTO인 Mira Murati가 설립한 Thinking Machines 연구소는 첫 번째 모델의 가중치(weights)를 공개했습니다. Inkling은 9750억 개의 파라미터(parameters)를 보유하고 있으며, 그중 410억 개가 활성화되어 있습니다. 이 모델은 외부 인코더(encoder) 없이 텍스트, 이미지, 소리를 직접 받아들입니다. Inkling에서는 오디오가 외부 인코더 없이 처리됩니다.
«ChatGPT 카자흐어»를 찾고 있으며 AI와 카자흐어로 음성 대화를 나누고 싶은 사람들에게 이 소식은 중요하지만, 솔직한 주의 사항이 있습니다. Inkling은 듣기는 하지만 말은 하지 못합니다. 즉, 텍스트로만 응답합니다. 따라서 오늘날 카자흐어 대화는 세 가지 경로로 이루어집니다. ChatGPT의 음성 모드, 카자흐스탄의 국가적 스택(stack), 그리고 자신의 음성 코퍼스(corpus)에 맞춰 오픈 모델을 미세 조정(fine-tuning)하는 것입니다. 각 방법은 저마다의 비용과 한계가 있습니다.
결제 조건 및 가용성은 선택한 서비스에서 확인하십시오. 실행 가능한 방법은 세 가지입니다: 해외 카드, 중개인, 그리고 provod.ai와 같은 애그리게이터(aggregator, 러시아의 OpenRouter)입니다. 이곳에서는 ChatGPT와 Gemini를 공식 요금에 따라 루블화로 이용할 수 있습니다. 접근성에 대해서는 마지막 부분에서 다시 다루겠습니다.
2026년 7월 15일에 무슨 일이 일어났으며, 왜 Inkling이 음성 AI의 전환점으로 불리는가
요약하자면: 오디오를 네이티브(native)하게 이해하는 최초의 open-weight 모델이 출시되었습니다. 소리는 이산적인 dMel-스펙트로그램(dMel-spectrograms)으로 분할되어 공통 토큰 스트림으로 직접 들어갑니다. Apache 2.0 라이선스 하의 가중치는 이미 Hugging Face에 올라와 있습니다. AudioMC 테스트에서 이 모델은 가장 가까운 오픈 경쟁자의 24.3%를 상회하는 56.6%를 기록했습니다. 다만, 음성 응답 기능은 없습니다.
이 방식은 encoder-free early fusion이라고 불립니다. 이미지는 4층 hMLP를 통해 40×40 패치(patch)로 입력되고, 오디오는 스펙트로그램(spectrogram)으로 입력되며, 이 모든 것이 초기 레이어(early layer)에서 텍스트와 혼합됩니다. 외부 인코더가 없는 이러한 아키텍처(architecture)는 이전에는 폐쇄형 연구소들의 전유물이었습니다. 2026년 7월 15일 Thinking Machines의 발표에 따르면, 사전 학습(pre-training)은 45조 개의 텍스트, 이미지, 오디오, 비디오 토큰을 대상으로 진행되었으며, 컨텍스트(context)는 최대 100만 개에 달합니다.
이 모델이 소리를 다루는 방식: 음성을 전사(transcribe)하고, 음성 지시를 수행하며, 녹음 내용에 대한 질문에 답하고, 긴 오디오에 대해 추론(reasoning)합니다. 실질적인 시나리오: 회의 내용을 녹음기로 녹음한 뒤, 파일을 업로드하여 전사본(transcript)과 항목별 분석 내용을 얻는 방식입니다. 이전에는 이를 위해 2~3개의 서비스를 조합해야 했습니다.
벤치마크(Benchmarks) - 해당 기업의 데이터이며, effort=0.99라는 점을 염두에 두세요. VoiceBench: Inkling이 91.4%를 기록하며 Qwen3-Omni의 88.8%, Gemini 3.1 Pro의 94.3%와 경쟁했습니다. MMAU: 77.2%로 77.5% 및 82.5%와 비교됩니다. AudioMC: 56.6%를 기록하여 Qwen3-Omni의 24.3%보다 두 배 이상의 격차를 보였습니다. 폐쇄형 모델(Closed models)이 여전히 앞서 있으며, Thinking Machines는 이를 다음과 같이 문자 그대로 인정합니다: "Inkling은 현재 오픈 모델 중에서도, 폐쇄형 모델 중에서도 가장 강력한 모델은 아닙니다." 여기서 저를 매료시킨 것은 수치가 아니라 어조입니다. 벤더(vendor)들이 자신의 출시 제품에 대해 이렇게 쓰는 경우는 드뭅니다.
ChatGPT가 카자흐어를 말할 수 있는지와 그 비용
요약하자면: 몇 가지 주의사항이 있지만 가능합니다. 음성 모드(Voice mode)는 유료 플랜의 경우 GPT-Live-1에서, 무료 플랜의 경우 GPT-Live-1 mini에서 작동합니다. 음성 모드는 50개 이상의 언어를 지원하며, 지원 목록에 카자흐어가 포함되어 있습니다. 2026년 7월 기준 OpenAI의 공식 FAQ에 따르면: Go 및 Plus 플랜은 이동 시간(rolling 24-hour period) 기준 최대 1시간의 전체 음성 사용과 최대 2시간의 mini 사용이 가능하며, 월 $200의 Pro 플랜은 제한 없이 사용 가능하되 한 번의 대화는 최대 2시간까지입니다.
설정 방법: Settings, 그 다음 Voice, 그다음 Language 순으로 이동하거나, 대화 중에 모델에게 직접 언어 변경을 요청할 수 있습니다. 아이폰에서의 경로도 동일합니다. 솔직한 주의사항을 덧붙이자면: 공식 Help Center는 언어 목록을 공개하지 않으며, 카자흐어가 포함된 목록은 2차 FAQ에서 나온 것입니다. 구독을 구매하기 전에 본인의 앱에서 사용 가능 여부를 확인하세요.
일부 사용자는 "app unavailable in region"이라는 문구를 보게 되는데, 이는 음성 기능이 계정의 지역(region)에 따라 달라지기 때문입니다. 이 경우 텍스트 채팅은 정상적으로 작동합니다.
품질 면에서도 환상은 버려야 합니다. 글로벌 모델들에게 카자흐어는 저자원 언어 (low-resource language)입니다. 학교 커리큘럼에서 추출한 23,000개의 질문으로 구성된 벤치마크 (Benchmark) KazMMLU는 GPT-4와 DeepSeek V3조차 고자원 언어 (high-resource languages)에 비해 카자흐어 성능이 눈에 띄게 떨어진다는 것을 보여줍니다. 2026년 7월 6일 MDPI Applied Sciences의 발표에 따르면, 법률 하위 집합 (subset)인 KazQAD에서 GPT-4o는 약 63%의 점수만을 기록했습니다. 일상적인 대화에는 충분하지만, 계약서나 정부 기관의 증명서를 다룰 때는 반드시 눈으로 직접 재확인해야 합니다.
지금 바로 해볼 수 있는 것:
- ChatGPT 앱을 열고 음성 모드 (voice mode)를 켭니다.
- 음성 설정에서 카자흐어를 선택하거나, 대화 중에 "카자흐어로 말해줘"라고 요청합니다.
- 제한 사항을 확인하세요: 무료 플랜은 미니 (mini) 모드이며, 전체 음성 기능의 1시간 제한은 Go 및 Plus 플랜에서 제공됩니다.
- 지역 관련 안내 문구가 보인다면, 해당 계정에 아직 음성 기능이 배포되지 않은 것이므로 텍스트를 사용하고 나중에 다시 확인하세요.
카자흐스탄이 이미 구축한 것들: KazLLM, Oylan 2.5, MangiSoz 및 Soyle
요약하자면: 카자흐스탄은 Inkling을 둘러싼 소음보다 더 오래전부터 자체적인 스택 (stack)을 보유하고 있었습니다. KazLLM은 Llama 3.1 아키텍처를 기반으로 1,500억 개 이상의 토큰으로 학습된 8B 및 70B 버전의 국가 최초 LLM (Large Language Model)으로, 2024년 12월 토카예프 대통령에게 "카자흐어 ChatGPT의 기반"으로서 소개되었습니다. 또한 Oylan 2.5는 2025년 11월부터 카자흐어, 러시아어, 영어로 텍스트 및 음성 질문을 처리하고 있습니다.
이 스택의 배후에는 나자르바예프 대학교(Nazarbayev University) 산하의 ISSAI 연구소가 있습니다. MangiSoz 2.0은 음성을 인식 및 합성하며 카자흐어부터 중국어까지 5개 언어로 번역합니다. TilSync는 실시간 자막을 생성하고, Soyle은 모바일 음성 번역기 역할을 합니다. KazLLM의 가중치 (weights)는 비상업적 라이선스로 Hugging Face에 공개되어 있습니다. Tengrinews의 보도에 따르면, 2026년 5월 4일 토카예프 대통령은 카자흐어를 디지털 시스템에 완전히 통합하고 아카이브를 학습용 데이터셋 (datasets)으로 전환할 것을 지시했습니다. 이 생태계는 단일 모델보다 훨씬 넓습니다: Sherkala, 멀티모달 (multimodal) Qolda, 그리고 KazMMLU, KazQAD, Qorgau, KazCulture와 같은 벤치마크들이 포함됩니다.
음성 합성 (Speech Synthesis)은 이미 콘텐츠에 적용되어 작동하고 있습니다. MangiSoz는 오디오북을 낭독하며, 검색을 통해 파악된 수요 프로필은 추리 소설, 판타지, 로맨스 소설, 카자흐어 버전의 «해리 포터 (Harry Potter)» 등입니다. 실제 성우들이 밀려날 가능성은 낮습니다. 스튜디오는 다른 차원의 억양을 제공하기 때문입니다. 하지만 TTS의 발행량은 스튜디오가 비용 문제로 맡지 않을 영역을 충족합니다. 일상적인 시나리오를 예로 들면, 회의 내용을 말로 녹음하고, 인식하여, mp3(mp3, мр3 - 어떻게 쓰든 동일)로 저장한 뒤, 봇과의 대화 내용은 exporter 확장 프로그램이나 온라인 컨버터를 통해 추출합니다. 카자흐어 지원 어시스턴트들은 Telegram(тг)에서도 활동 중입니다.
Inkling이 여기서 어떤 역할을 하며, 오픈 웨이트 (open weights)가 카자흐어 음성에 무엇을 제공하는가
요약하자면: "Inkling이 카자흐어를 말한다"라는 직접적인 답변은 없습니다. 모델 카드에는 "English and other languages"라고 기재되어 있으며, 카자흐어는 별도로 명시되지 않았습니다. 가치는 다른 곳에 있습니다. 이것은 카자흐어 코퍼스 (corpus)로 미세 조정 (fine-tuning)할 수 있는, 네이티브 오디오를 지원하는 최초의 오픈 소스 기반이라는 점입니다. 웨이트 (weights)는 Hugging Face에 있으며, 파인튜닝 (fine-tuning)은 Tinker에서 이루어집니다.
실제 구현 방식은 다음과 같습니다. 웨이트는 두 가지 형태, 즉 원본 BF16 체크포인트와 NVIDIA Blackwell 칩을 위한 NVFP4로 제공됩니다. 미세 조정은 Thinking Machines 자체의 파인튜닝 API인 Tinker를 통해 진행됩니다. 컨텍스트 (context) 길이는 64K 및 256K를 지원하며, 2026년 7월 15일 발표에 따라 초기에는 50%의 제한적인 할인이 적용됩니다. Tinker 콘솔의 플레이그라운드 (playground)에서도 테스트해 볼 수 있으며, 초기에는 무료입니다. 완성된 호스팅 API (hosted API)는 TogetherAI, Fireworks, Modal, Databricks, Baseten이 제공하며, 로컬 인퍼런스 (local inference)는 transformers, SGLang, vLLM, TokenSpeed, llama.cpp를 통해 가능합니다.
하드웨어의 제약은 현실을 직시하게 합니다. BF16은 총 약 2TB의 VRAM을 요구하는데, 이는 노트북이 아닌 서버 랙 수준의 사양이며, NVFP4는 B200 및 GB200 칩에 종속되어 있습니다. 따라서 이 기반으로 카자흐어 음성 어시스턴트를 제작한다면 다음과 같은 순서를 따르게 됩니다:
- Hugging Face에서 웨이트를 가져오거나 호스팅 API를 사용합니다. 가정용 플래그십 장비로는 구동할 수 없습니다.
- 카자흐어 코퍼스를 수집합니다: 음성과 전사 (transcripts)를 포함하며, 대통령의 지시에 따라 데이터셋으로 변환되는 아카이브들도 포함됩니다.
- Tinker에서 64K 또는 256K 컨텍스트로 미세 조정을 진행합니다.
- 음성 답변은 별도의 TTS를 통해 출력합니다. 예를 들어 카자흐스탄의 MangiSoz를 사용하는데, 모델 자체가 직접 소리를 생성하지는 않기 때문입니다.
계산 시 유용할 발표 내용 중 두 가지 사실이 더 있습니다. controllable thinking effort (조절 가능한 사고 노력) 기능은 추론 예산을 0.2에서 0.99까지 소프트웨어적으로 조절합니다. Terminal Bench 2.1에서 Inkling은 Nemotron 3 Ultra를 바짝 추격하면서도 토큰은 약 3배 적게 소모합니다. 이와 동시에 Inkling-Small의 프리뷰도 공개되었습니다. 이 모델은 2,760억 개의 파라미터(parameters)를 보유하며, 그중 120억 개가 활성(active) 상태이고 VoiceBench에서 90.0%를 기록하여 일부 구간에서는 상위 모델에 뒤처지지 않습니다. 전체 가중치(weights)는 테스트 완료 후 공개될 예정입니다.
| 방식 | 입력 음성 | 출력 음성 | 카자흐어 | 2026년 7월 기준 가격 및 제한 | 개방성 |
|---|---|---|---|---|---|
| ChatGPT Voice (GPT-Live-1) | 예 | 예 | 지원 목록에 포함됨 | Go/Plus: 일일 1시간 + 2시간 mini; Pro 월 $200 무제한 | 폐쇄형 |
| ... | |||||
| 이 표의 내용을 기사가 끝나기를 기다리지 않고 실제 모델에서 직접 확인할 수 있습니다: provod.ai의 텍스트, 코드 및 파일 작업용 모델들은 하나의 루블 잔액으로 통합되어 있으며 VPN 없이도 이용 가능합니다. 카자흐어 프롬프트(prompt)를 채팅창에 직접 입력하여 답변을 비교해 볼 수 있습니다. |
이것이 해결하지 못하는 것과 혼동되는 지점들
요약하자면 세 가지입니다. Inkling은 음성을 생성하지 않고 오직 소리를 수용할 뿐입니다. ChatGPT Voice는 사용 시간에 제한이 있습니다. 글로벌 모델들의 카자흐어 능력은 영어에 비해 현저히 낮습니다. 또한, 이 주제는 음악 및 이미지 생성이라는 두 가지 시끄러운 이웃과 혼동되기도 합니다.
Inkling에는 음성 답변 기능이 없습니다. 모델은 소리를 듣고 텍스트로 작성합니다. "실시간" 대화를 위해서는 외부 음성 합성기(synthesizer)가 필요한데, 이는 별도의 구성 요소이며 별도의 비용이 발생합니다.
보안과 관련하여 회사는 외부 모더레이션 (moderation, 예: Llama Guard)을 권장합니다. FORTRESS Adversarial 테스트에서 모델은 78.0%, Benign 테스트에서는 95.9%를 유지하지만, 역할극 (role-play) 및 간접적으로 표현된 유해한 요청에는 취약합니다. "성적인" 내용과 같은 요청은 모델에 도달하기 전 플랫폼 단계의 필터에서 차단됩니다.
별도로 - 회색 키 (grey keys). "fanpay", "funpay", "ggsel", "pleyerok" 및 Ozon을 통한 결제 요청은 계정 및 키 마켓플레이스로 연결됩니다. 리스크는 일반적입니다: 계정이 회수될 수 있고, 돈은 돌려받지 못하며, 대화 내용은 판매자에게 남습니다. 합법적인 대안은 계좌를 통한 루블화 결제입니다.
첫 번째 이웃은 음악입니다. "ai cover", "нейросеть песня монстр" (신경망 노래 몬스터), "блатные треки с маmat" (욕설이 포함된 범죄 음악), "ai cover kani", "алые розы" (붉은 장미)의 신경망 처리 버전, "охотник" (사냥꾼), "лара" (라라), "рать" (군대), 트랜스 및 rock과 같은 요청은 노래 및 커버 생성과 그 결과물로 나오는 mp3 (mp3, мр3)에 관한 것입니다. 그곳에는 그들만의 서비스와 저작권 문제가 있으며, 이는 카자흐어 음성 채팅과는 관련이 없습니다.
두 번째 이웃은 이미지입니다. 만약 당신이 dall (prompt의 오타)을 위한 prompt를 찾았거나 - 즉 DALL-E, Topaz를 통한 upscale, 오래된 사진을 위한 enhancer, ComfyUI와 fooocus의 조합, YandexART, bing image creator 또는 dark 필터를 찾았다면 - 이 글은 그것에 관한 것이 아닙니다. Inkling은 이미지를 볼 줄은 알지만, 그릴 줄은 모릅니다: 모델의 출력은 텍스트뿐입니다.
하나의 API를 통해 자신만의 음성 스택을 구축하고 루블로 결제하는 방법
요약하자면: 만약 카자흐어 음성이 필요하다면 이는 제품 과제 (자신만의 어시스턴트, 콘텐츠 더빙, 회의 전사)이며, 이러한 과제는 코드로 해결합니다. 단일 API를 통해 모델에 연결하는 것은 키(key)와 base_url이라는 두 줄을 바꾸는 것으로 요약됩니다.
ChatGPT의 일일 음성 제한이 소진되었을 때 무엇을 사용할 수 있을까요? 실행 가능한 옵션은 팀의 중단 없이 동일한 루프를 통한 텍스트 fallback (대체 수단)입니다. 서비스 문서에서 지원되는 SDK 및 엔드포인트를 확인하세요:
from openai import OpenAI
client = OpenAI(
...
하나의 루블 잔액으로 채팅과 프로덕션을 모두 해결할 수 있습니다: 러시아 카드, SBP(Fast Payment System) 또는 계좌 결제가 가능하며, 법인의 경우 계약 및 증빙 서류가 제공됩니다. 새롭고 수요가 높은 모델들이 최대한 빠르게 추가되므로, 오디오 스택이 대중적인 API에 도달하더라도 통합 구조를 다시 구축할 필요는 없습니다.
provod.ai가 적합하지 않은 경우
요약하자면, 이 주제에는 세 가지 사례가 있습니다. 만약 ChatGPT 특유의 목소리와 제한 사항을 가진 시그니처 음성 모드 (Voice Mode)가 필요하다면, 이는 OpenAI의 구독 기능이며 벤더(vendor)에 대한 직접적인 구독이 필요합니다.
두 번째 사례는 자신의 하드웨어 또는 Tinker에서 Inkling을 미세 조정 (Fine-tuning)하는 경우입니다. 애그리게이터 (Aggregator)는 GPU 성능, Hugging Face, 또는 카자흐어 말뭉치 (Corpus) 작업 그 무엇도 대체할 수 없습니다. 세 번째는 카자흐스탄 제품들입니다: Oylan 2.5, MangiSoz, Soyle는 별도의 국가적 스택 (Stack)이며, 아무도 이를 애그리게이트하지 않고 ISSAI로 직접 연결됩니다. 글로벌 모델에 대한 접근과 루블화 결제 문제는 애그리게이터를 통해 해결되지만, 그 외의 사항들은 벤더 및 아스타나 (Astana)에서 해결됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기