토큰은 지팡이에 불과하다: 왜 바이트 모델이 장기적인 승자가 되는가
요약
기존 언어 모델의 토큰화 방식이 사실상 한계에 다다랐으며, 원시 바이트를 처리하는 바이트 레벨 모델(byte-level models)이 장기적인 관점에서 더 우월하다는 연구 결과가 제시되었습니다. 이 모델들은 적은 데이터와 컴퓨팅 자원으로도 높은 성능을 유지하며 언어적 편향성 문제를 해결할 수 있습니다.
핵심 포인트
- 토큰화 방식은 초기에는 효과적이나, 바이트 레벨 모델이 장기적으로 우위를 점함.
- 바이트 모델은 토크나이저 없이 원시 바이트를 처리하여 언어별 비용 불균형을 해소함.
- 바이트 모델은 적은 학습 데이터와 컴퓨팅 자원으로도 높은 성능 잠재력을 가짐.
지금까지 사용해 본 모든 언어 모델에는 비밀이 있습니다. 바로 프롬프트를 읽기 전에 토크나이저(tokenizer)가 그것을 조각으로 자른다는 것입니다. 'Tokenization'은
["Token", "ization"]처럼 나뉩니다. 힌디어는 색종이 조각처럼, 중국어는 톱밥처럼 변합니다. 이 잘라내는 과정은 마치 트랜스포머(transformer) 자체만큼 영구적인, 정착된 인프라로 취급됩니다.
University of Washington과 Meta FAIR가 발표한 2026년 9월의 논문에 따르면 이는 지팡이에 불과합니다. 그들의 발견은 다음과 같습니다. 토큰화된 모델(tokenized models)은 학습 초기에 빠르게 앞서나가지만, 이후 정체됩니다. 반면, 원시 바이트를 읽는 바이트 레벨 모델(byte-level models)—토크나이저가 전혀 필요 없는 모델—은 시작은 느리지만 계속해서 상승합니다. 올바른 변환을 통해 1B의 바이트 레벨 학생 모델을 토큰화된 Llama 3-8B 교사로부터 추출했을 때, 적합한 스케일링 법칙(scaling laws)에 따라 이 모델은 컴퓨팅 점근선(compute asymptote)에서 증류된 토큰 모델보다 4% 앞서나가지만, 학습 데이터는 1/6만 필요하고, 교사 로짓 저장 공간(teacher-logit storage)도 1/5만 필요합니다. 단점은 이 헤드라인이 오늘날의 체크포인트가 아니라 외삽된 스케일링 곡선에서 살아있다는 것입니다. 입증된 것과 예측되는 것을 분리해 봅시다.
ELI5: 알파벳 대 레고 세트
아이에게 읽는 법을 두 가지 방식으로 가르친다고 상상해 보세요. 토큰 방식은 다음과 같습니다. 128,000개의 미리 붙여진 단어 조각(
English는 12 토큰이 필요하고, Hindi는 51 — 같은 의미에 대해 4.25배 더 많은 토큰을 사용합니다. 아랍어는 40개가 필요합니다. 토큰당 API 가격으로 따지면, Hindi 사용자는 동일한 문장에 대해 English 사용자보다 4배를 지불하게 됩니다. 토크나이저는 English 기반이며, 다른 언어를 사용하는 모든 사람이 그 차액만큼 비용을 더 지불하는 구조입니다. 반면, 바이트 모델은 바이트 단위로 요금을 부과합니다: English는 66바이트에 대해, Hindi는 128바이트에 대해 청구하며 — 이는 토크나이저의 편애가 아닌 실제 정보량 콘텐츠를 반영한 1.9배 비율입니다.
작동 방식: 선생님은 토큰으로 말하고, 학생은 바이트로 말한다
이 논문의 핵심 질문은 단순히 '바이트가 더 좋은가'라는 것보다 훨씬 좁고 실용적입니다: 거대한 토큰 기반의 교사(teacher)로부터 바이트 수준의 학생(student)을 증류해낼 수 있는가? 이것이 중요한 이유는 Llama 3, Qwen, Gemma와 같은 모든 우수한 교사 모델들이 토큰화되어 있기 때문입니다. 만약 바이트 학생 모델들이 이들로부터 학습할 수 없다면, 바이트 사전 학습은 제로(zero)부터 시작해야 합니다.
가장 어려운 부분은 변환 과정입니다. 교사는 128,000개 토큰에 대한 확률을 출력합니다. 반면, 학생은 256바이트에 대한 확률이 필요합니다. 'tokenizer'와 같은 하나의 토큰은 9바이트를 차지하므로 — 따라서 하나의 토큰 확률은 9개의 바이트 위치에 걸쳐 분할되어야 하며, 하나의 바이트 위치는 많은 토큰 경로(
End-of-Token (정확히): 바이트 알파벳에 하나의 기호 — 명시적인 토큰 종료 마커 ⟨eot⟩를 추가합니다. 이제 토큰→바이트 매핑은 전사(bijective)가 됩니다. 모든 토큰화는 정확히 하나의 바이트+⟨eot⟩ 시퀀스에 해당하므로, 교사의 전체 분포는 근사 손실이 0인 상태로 학생에게 전달됩니다. 256개의 바이트 + 1개의 마커 = 257개 기호의 어휘 크기이며, 이는 128,000개의 토큰에 비해 적습니다.
학생 모델들은 Llama 3-8B 교사를 상대로 최대 1조 바이트로 학습된 파라미터 매칭(parameter-matched) 1B 모델들입니다. 이들은 여섯 가지 다운스트림 벤치마크(ARC-Easy, ARC-Challenge, HellaSwag, PIQA, MBPP, Natural Questions)와 전체 평가에서 추가된 두 개의 벤치마크를 포함하여 평가되었습니다.
최첨단 기술 현황: 숫자들이 실제로 말하는 것
적합한 거듭제곱 법칙(fitted power laws)들은 학습 FLOPs, 검증 비트-바이트(validation bits-per-byte), 그리고 다운스트림 정확도 전반에 걸쳐 명확한 이야기를 들려줍니다:
- 토큰 증류 학생 모델은 낮은 컴퓨팅 파워에서 선두를 달리다가 평탄해집니다. 토크나이저는 초기에 진정으로 유용한 발판 역할을 합니다.
- 바이트 증류 학생 모델은 컴퓨팅 파워가 증가함에 따라 토큰 곡선을 돌파하며, 토큰 모델들이 포화되는 지점에서도 계속 상승합니다.
- End-of-Token이 Asymptote(점근선)에서 Marginalize-It보다 1.9% 우수합니다. 정확성이 빛을 발합니다.
- End-of-Token은 Asymptote에서 증류된 토큰 모델보다 4% 앞서며, 개방형 가중치(open-weight) 1B–2B 모델들보다 평균 다운스트림 작업에서 최대 6.5%(Llama 3.2-1B), 8.1%(Gemma-3-1B-pt), 그리고 2.1%(Gemma 2B)까지 앞섭니다.
- 효율성이 숨겨진 결과입니다: 바이트 학생 모델은 훈련 데이터의 1/6에 불과한 양으로 증류된 토큰 모델과 동등하며, 256개 항목의 어휘 크기는 교사 로짓(teacher-logit) 저장 공간을 1/5로 줄여줍니다. 따라서 증류 실행 비용이 저장 및 재현 측면에서 더 저렴해집니다.
가장 많이 잘못 다루는 부분이 바로 여기이므로, 세 가지 솔직한 주의사항을 덧붙입니다:
- 바이럴 스레드가 새로운 것에 대해 잘못 알고 있다. 지난 9월에 올라온 X(구 트위터) 스레드는 Meta의 Byte Latent Transformer를 완전히 새로운 돌파구처럼 제시했다. BLT는 이미 2024년 12월에 나온 것이다. 이번 논문은 증류(distillation) 연구이며, 같은 연구 계보(5명의 저자가 중복됨)에서 나온 다른 기여이다. 바이트 스케일링 이야기는 단 하나의 유레카 순간이 아니라 여러 논문에 걸친 _트렌드_다.
- 가장 큰 승리는 외삽(extrapolations)에 있다. 이 논문의 헤드라인 격차는 실제로 테스트된 컴퓨팅량보다 더 먼 곳까지 확장된 적합 스케일링 법칙에서 비롯되었다. 오늘날 훈련된 체크포인트 기준으로, 바이트 모델은 우세하다기보다는 경쟁력이 있는 수준이다. 점근선(asymptote)을 결과가 아닌 오차 막대가 있는 예측치로 취급해야 한다.
- 교사(teacher)는 여전히 토큰화되어 있다. 이것은 토큰 모델로부터의 증류이며, 최첨단 규모에서 토큰이 없는 사전 훈련이 작동한다는 증거가 아니다. 학생(student)은 교사의 지식을 물려받는다. 아무도 바이트 모델이 70B 이상의 규모에서 모든 것을 처음부터 학습하는 것을 보여주지 못했다.
핵심 시사점 (Takeaways)
- 토큰화는 단순한 인프라를 넘어 성능의 상한선이다. 이는 모델을 초기에 정체시키고 비영어권 언어에 2~4배의 부담을 준다. 만약 다국어 사용자를 대상으로 서비스를 제공한다면, 토크나이저는 가격 결정(pricing) 문제와 직결된다.
- 증류가 연결고리이다. 기존의 토큰화된 교사 모델들을 포기할 필요는 없다. End-of-Token 변환은 그 지식을 바이트 학생에게 손실 없이, 데이터 양의 1/6 수준으로 옮긴다.
- 바이트로 전환하기 위한 전략: 소형 모델 + 긴 훈련 예산 + 다국어 워크로드. 스케일링 법칙이 바로 이 지점에서 바이트가 승리한다고 말한다. 짧은 예산의 영어 전용 훈련이라면, 기존 토크나이저를 유지하는 것이 좋다.
- 과대광고(hype)가 아닌 컴퓨팅량 교차점을 주목하라. 바이트 모델은 오늘날 대부분의 팀들이 훈련하는 예산 규모에서는 뒤처지지만, 곡선이 교차하는 지점에서는 승리한다. 전략적인 질문은 여러분의 훈련 예산이 그 교차점과 비교하여 어디에 위치하느냐이며—그리고 이 지점은 방법론 개선에 따라 왼쪽으로 이동하고 있다.
토크나이저는 의심할 여지 없는 인프라로서 10년 동안 군림했다. 그럴 만한 가치가 있었다. 하지만 '우리가 항상 해왔던 방식'은 스케일링 법칙이 아니며—이제 우리는 스케일링 법칙을 갖게 되었다.
논문: Marathe et al., "Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models," arXiv 2609.12303 (2026년 9월 11일). 출산성 측정값은 tiktoken cl100k_base를 통해 얻었으며. 다이어그램 1의 스케일링 곡선은 논문에서 보고된 추세에 맞춰 작성된 예시입니다 — 점근선 간격은 논문의 수치이며; 교차점 배치는 예시적입니다.
동반 노트북: 이 게시물의 실행 가능한 튜토리얼 — 여기서 다운로드 (Colab/Jupyter에서 열기).
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기

