
토크나이저 확장: LFM2.5-8B-A1B 모델의 토크나이저 인플레이스 업그레이드
요약
LFM2.5-8B-A1B 모델의 토크나이저를 처음부터 다시 학습하지 않고 인플레이스 방식으로 업그레이드하는 기술을 소개합니다. 어휘 사전 크기를 65K에서 128K로 확장하여 기존의 과도한 언어 분할 문제를 해결했습니다.
핵심 포인트
- 사전 학습된 모델의 토크나이저를 인플레이스 방식으로 업그레이드
- 어휘 사전(vocabulary)을 65K에서 128K로 두 배 확장
- 기존 토크나이저의 과도한 언어 분할 문제 해결
오늘 저희는 LFM2.5-8B-A1B의 새로운 토크나이저(tokenizer) 뒤에 숨겨진 레시피를 공유합니다. 이는 처음부터 다시 학습(retraining from scratch)하지 않고, 사전 학습된(pre-trained) 모델의 토크나이저를 인플레이스(in place)로 업그레이드합니다. 기존 토크나이저가 너무 잘게 분할했던 언어 문제를 해결하기 위해 어휘 사전(vocabulary)을 65K에서 128K로 두 배 늘렸습니다. 블로그: liquid.ai/blog/tokenizer-expansion 기술 보고서: arxiv.org/abs/2607.15232 Hugging Face: huggingface.co/LiquidAI/LFM2.5-8B-A1B
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기