- mlx: publisher 토크나이저 의미론 일치 pretokenizer 단계 순서, 분할 동작, Unicode 경계, added-token
요약
mlx: publisher 토크나이저가 의미론적 일치성을 높이기 위해 pretokenizer 단계 순서, 분할 동작, Unicode 경계 처리를 개선했습니다. 또한 added-token 정규화 및 BPE 병합 과정을 개선하고, 빈 입력에 대한 처리 일관성을 확보하여 안정성을 높였습니다.
핵심 포인트
- pretokenizer 단계와 분할 동작을 개선하여 의미론적 일치성 향상
- Unicode 경계 및 added-token 정규화 로직 강화
- 빈 Metaspace 입력과 added 토큰 처리를 일관되게 처리
- 공유 참조 케이스 추가 및 회귀 테스트를 통해 안정성 확보
- mlx: publisher 토크나이저 의미론 일치
pretokenizer 단계 순서, 분할 동작, Unicode 경계, added-token 정규화, 그리고 순위별 BPE 병합을 개선했습니다. 빈 added 토큰과 빈 Metaspace 입력을 일관성 있게 처리합니다.
게시된 토크나이저를 사용하여 공유 Go/Python 참조 케이스를 추가하고, 누락된 모델을 직접 가져오며 오류 발생 시 실패하도록 했습니다. 또한 설정 우선순위, 바이트 폴백(byte fallback), 그리고 병렬 인코딩에 대한 집중적인 회귀 테스트도 수행했습니다.
- 주석 처리된 부분 해결
AI 자동 생성 콘텐츠
본 콘텐츠는 RSS: GitHub ollama/ollama releases의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기