Agogic: LLM 네이티브 텍스트-심볼릭-음악 생성을 위한 성능 시간 기반 음악 토큰
요약
LLM 기반 텍스트-음악 생성에서 모델 크기보다 토큰화 방식이 성능의 핵심임을 입증한 연구입니다. 새로운 성능 시간 기반 음악 토큰(PMT)을 제안하여 기존 비트 그리드 방식보다 훨씬 뛰어난 음악적 충실도를 달성했습니다.
핵심 포인트
- 모델 크기 확장보다 효과적인 음악 토큰화 표현이 성능 향상에 더 결정적임
- PMT 토큰은 0.8B 모델로도 27B 모델보다 우수한 음악적 거리(FMD) 기록
- 디코드 타임 제약을 통해 악기 분리 및 키 정확도를 두 배로 향상 가능
- 대규모 음악 코퍼스와 진단 도구 및 25개 이상의 체크포인트 공개
텍스트-음악 (Text-to-music) 언어 모델은 보통 기본적으로 결정되는 선택 사항인 '음악을 어떻게 토큰화(tokenize)할 것인가'에서 시작합니다. 일반적으로 백본 (backbone), 데이터, 레시피 (recipe)와 뒤엉켜 있어, 그 효과가 독립적으로 측정된 적은 없습니다. 우리는 사전 학습된 Qwen3.5 (0.8B-27B), 데이터, 예산, 디코딩 (decoding)을 고정하고, 7가지 토큰화 방식에 따라 표현 (representation)만을 교체하며, 각 표현의 모델 프리 (model-free) 상한선에 텍스처 지표 (texture metrics)를 고정했습니다. 그 결과는 명확하고 놀라웠습니다. 분포적 충실도 (distributional fidelity)를 결정짓는 핵심 변수는 모델 크기가 아니라 표현이었습니다. 백본을 34배 확장해도 프레셰 음악 거리 (Frechet Music Distance, FMD)는 거의 변하지 않았으나, 표현을 전환하자 FMD가 절반으로 줄었습니다. 우리가 공개하는 성능 해상도 스트림인 PMT (10ms 타이밍, 음표별 벨로시티 (velocity), 멀티트랙 텍스처; 609개 심볼)는 0.8B 모델에서 FMD 159를 기록하여, 비트 그리드 (beat grids)의 272-286과 비교했을 때 우위를 점했습니다 (1.7-1.8배 낮음, 다른 곳에서는 최대 2.8배 낮음; 비중첩 부트스트랩 신뢰 구간 (bootstrap CIs)). 즉, 0.8B 성능 해상도 모델이 27B 비트 그리드 모델을 이깁니다. 이러한 현상은 처음부터 학습시킨 26M 백본과 두 번째 성능 해상도 토크나이저에서도 재현되었습니다. 이는 운 좋게 선택된 어휘 (vocabulary)의 특성이 아니라, 해당 클래스의 속성입니다. 또한 이는 더 미세한 격자 (finer-lattice)의 산물도 아닙니다. PMT의 온셋 (onsets)을 비트 그리드의 해상도에 맞추더라도 여전히 두 방식보다 67-129 FMD 앞서 있습니다 (n=500). 이 효과는 분포적입니다. 이것이 청각적으로 들리는지는 별개의 문제이며, 사전 등록된 인간 대상 연구를 통해 확인될 예정입니다. 네이티브 캡션 준수 (Native caption adherence) 능력은 약하지만 분리가 가능합니다: 가벼운 디코드 타임 제약 (decode-time constraint)을 적용하면 분포적 비용 없이 악기-F1 (.28에서 .60으로)과 정확한 키 (Correct-Key, .16에서 .35로)를 두 배로 높일 수 있습니다. 우리는 하네스 (harness), 25개 이상의 체크포인트 (checkpoints), 두 개의 코퍼스 (caption/MIDI/ABC/audio가 정렬된 86.6k; 음악 분야 최대 규모인 캡션이 달린 6.25M), 그리고 임프린팅 진단 도구 (imprinting diagnostic)를 공개합니다: 기존에 발표된 텍스트-MIDI 시스템들은 캡션과 무관하게(disjoint domains에서 코드-타임 72% 대 71%) 학습 분포를 거의 불변하게 재현합니다. 이제 이 분야의 차세대 표현에 대한 주장은 단순히 주장되는 것이 아니라 측정될 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기