mlsubgen — 자체 장치에서 45개 언어로 비디오 자막 생성
요약
mlsubgen은 자체 장치에서 45개 언어로 비디오 자막을 생성하는 도구입니다. 일반적인 Whisper 래퍼와 달리, 모든 발화 구간의 언어를 감지하여 혼합 언어 자료도 처리할 수 있습니다. 또한 오디오 외에 내장된 자막 트랙이나 Blu-ray 리먹스에서 OCR까지 수행합니다.
핵심 포인트
- 자체 장치 구동 및 45개 언어 지원
- 발화 구간별 언어 감지 기능으로 혼합 언어 처리 가능
- 오디오뿐 아니라 내장 자막/OCR 등 다양한 소스 활용
- Linux와 NVIDIA 환경에서만 사용 가능
전체 면책 조항: 저는 Fable에 크게 의존하여 이것을 개발했지만, GitHub에 올리기 전에 몇 달 동안 제 개인 라이브러리에서 철저하게 테스트했습니다.
저는 태국에 살고 있으며, 처음에는 태국 친구들과 태국 파트너가 있는 외국인 거주자 친구들을 위해 신짱의 태국어 자막을 얻는 방법으로 시작되었습니다. 이것은 일반적인 도구로 발전하여 자체 장치에서 45개 언어로 자막을 생성할 수 있게 되었습니다. 아쉽게도 Linux와 NVIDIA만 지원합니다.
일반적인 Whisper 래퍼와 다른 점은 파일 단위가 아닌 모든 발화 구간의 언어를 감지한다는 것입니다. 따라서 혼합 언어 자료도 처리 가능하며, 모든 것에 대해 두 개의 음성 인식기를 실행하고 로컬 LLM이 이를 조정합니다. 또한 기계 추론보다 기존 인간의 작업을 선호하여 오디오보다 내장된 자막 트랙을 사용하며, Blu-ray 리먹스에서 비트맵(PGS) 트랙에 대한 OCR도 수행합니다. 그리고 읽을 것이 없을 때만 듣습니다. 이 모든 기능은 주장하는 대신 README에 측정된 정확도로 명시되어 있습니다.
저는 24 GB RTX A5000으로 실행했습니다. 16GB, 12GB, 8GB 카드용 프로필이 있으며, 이는 해당 카드가 아닌 제 카드에서 크기에 제한하여 측정한 것이므로 실제 사용 후기를 보내주시는 것이 가장 유용할 것입니다. 시스템 RAM은 프로필에 따라 16–32 GB가 필요하며, 작업과 언어 쌍에 맞는 모델을 선택하기 때문에 저장 공간을 많이 차지합니다(모델 용량 30–65 GB).
듣는 과정에서는 느립니다. 제 카드 기준으로 목표 언어당 실시간 정도이며, 속도보다는 정확도가 전체 목표였기 때문에 더 작은 프로필에서는 더 느립니다. 자막이 파일에 이미 존재하는 경우에는 빠릅니다.
사람들이 이것을 사용해보고 이슈를 열어주시면 좋겠습니다.
제출자: /u/Dodgy_Past
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기