인증된 분할: 최대-만치 토큰화의 결정 가능성과 앵커 공급
요약
본 논문은 '인증된 분할(Certified Splitting)' 개념을 제시하며, 입력 데이터의 원점 기반 토큰화와 편집에 대한 결정론적 방법을 다룹니다. 인증 메커니즘을 통해 앵커를 산출하고, 이를 이용해 추측이나 수정 없이 데이터를 정확하게 잘라내고 감사하는 방법을 설명합니다.
핵심 포인트
- 인증된 위치는 작업 시작 지점을 명확히 표시하여 데이터 처리의 확실성을 높입니다.
- 온라인/오프라인 두 가지 방식으로 인증을 결정하며, 앵커 목록과 증인을 산출합니다.
- 이 방법은 토큰화 가능한 바이트 치환에도 불구하고 경계를 안정적으로 유지합니다.
- 구분자 실패를 방지하고, 데이터 분할 및 감사를 위한 강력한 도구를 제공합니다.
인증서(certificate)란 그 내부 원점(origin)을 가진 바이트들의 창(window)입니다. 이 창이 완전히 토큰화 가능한 입력에서 어디에 발생하든, 창의 마지막 바이트를 커버하는 토큰은 그 원점에서 시작합니다. 오직 토큰 세트만으로 결정되는 인증된 위치는 작업이 확실하게 시작할 수 있는 지점을 표시합니다. 본 논문은 인증(certification)을 결정하고, 그 앵커들을 앞으로 읽어내어 잘라내기(cuts), 편집하기(edits) 그리고 감사(audits)에 적용합니다. 인증은 두 가지 방식으로 결정됩니다: 리터럴 어휘(literal vocabularies)의 완전성 차단점(completeness cutoff)을 이용한 온라인 방식과, 임의의 정규 토큰 세트(regular token sets)를 위한 무장 실행 검증기(armed-run verifier)를 통한 오프라인 방식입니다. 두 경로 모두 선언된 창 예산(window budget) 하에서 앵커 목록(anchor inventory)을 산출하며, 거부 시에는 각 증인(witness)이 제공됩니다. 그 결과는 정리들(theorems)로 이어집니다. 인증된 앵커에서 입력을 잘라내고 청크들을 독립적으로 스캔하면, 추측이나 수정 패스 없이 순차적 분할을 재현합니다. 입력에 토큰화가 가능한 바이트 치환이 발생하더라도 경계는 오직 그 양쪽에 있는 변경되지 않은 바이트들에서 증명된 인증 앵커 사이에서만 이동합니다. 길이가 최대 L인 토큰의 경우, p에서의 편집은 p - L + 1 이하에서는 어떤 경계도 이동시키지 않습니다. 구분자(delimiter)는 자신이 정확히 토큰 시작 위치에 있을 때 그 앞에서 확실하게 잘릴 수 있게 하고, 오직 토큰 끝 위치에 있을 때 그 뒤에서 확실하게 잘릴 수 있게 하여, 임베디드-구분자 실패(embedded-delimiter failure)를 거부합니다. 두 가지 도구가 따릅니다: 유한 인증 목록의 앵커 프리 스팬(anchor-free span)으로, 경계가 정해졌든 아니든 정확한 상한값과 함께 결정됩니다. 세 번째는 두 토큰 세트가 모두 토큰화하는 입력에 대해 서로 다른 경계를 배치하는지 여부를 증인과 함께 결정하는 차분 감사기(differential auditor)입니다. 모든 정리는 실행 가능한 검사(executable check)를 수반합니다. 모든 측정은 이름 붙여진 프로그램의 출력 또는 그러한 출력에 대한 산술 연산이며, 각 프로그램은 논문과 함께 제공되거나 연구하는 라이브러리의 커밋으로 고정됩니다; 해당 라이브러리의 스레드 스캐너는 아카이브된 캠페인 코퍼스(archived campaign corpus)를 인증 앵커에서 분할하며, 그 경계 스트림은 전체적으로 바이트 단위로 동일합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.PL (Programming Languages)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기