OctoLong: 교차 리포지토리 코드 컨텍스트에 대한 미드 트레이닝(Mid-Training)을 통한 롱 컨텍스트(Long-Context)
요약
OctoLong은 AST 파서와 언어 서버를 활용해 수백만 토큰 규모의 의존성이 풍부한 코드 컨텍스트를 구축하는 파이프라인입니다. 이를 통해 학습된 OctoLong-Instruct 모델은 기존 모델 대비 리포지토리 수준의 코드 이해와 장기 에이전트 작업에서 탁월한 성능을 보입니다.
핵심 포인트
- AST 및 언어 서버 기반의 재귀적 코드 컨텍스트 큐레이션 파이프라인 제안
- 62억 토큰 규모의 고품질 코드 컨텍스트 데이터셋 구축
- 미드 트레이닝을 통해 600M~14B 규모의 롱 컨텍스트 모델 개발
- 기존 데이터의 12%만 대체해도 장거리 검색 및 코드 이해 성능 대폭 향상
언어 모델(LM)의 컨텍스트 길이(Context lengths)는 인컨텍스트 학습(In-context learning), 자기 개선(Self-improvement), 그리고 장기적 에이전트 워크플로우(Long-horizon agentic workflows)에 대한 요구에 따라 급격히 증가해 왔습니다. 그러나 기존의 롱 컨텍스트 코퍼스(Long-context corpora)는 도서, 학술 논문, 그리고 코드 리포지토리(Code repositories)가 주를 이루고 있으며, 이는 유한한 자원이며 장거리 의존성(Long-distance dependencies)이 부족한 경우가 많습니다. 본 연구에서는 AST 파서(AST parser), 언어 서버 백엔드(Language server backend), 그리고 패키지 매니저(Package manager)를 활용하여 코드 참조의 재귀적 검색을 용이하게 하는 컨텍스트 엔지니어링 파이프라인인 OctoLong을 소개합니다. 이를 통해 수백만 토큰 길이에 달하는 의존성이 풍부한 코드 컨텍스트를 큐레이션할 수 있습니다. 이후 우리는 약 62억 토큰의 OctoLong 코드 컨텍스트를 포함하는 약 500억 토큰 규모의 혼합 데이터셋을 사용하여, 600M에서 14B 파라미터 규모의 베이스 모델로부터 파생된 유능한 롱 컨텍스트 오픈 LM 제품군인 OctoLong-Instruct를 컨텍스트 확장 미드 트레이닝(Context-extension mid-training)과 약 100억 토큰의 인스트럭션 튜닝(Instruction tuning)을 통해 학습시켰습니다. 우리의 학습 절제 연구(Ablations) 및 18개의 최첨단 오픈 웨이트(Open-weight) 롱 컨텍스트 LM과의 실험적 평가 결과, 전통적인 컨텍스트 확장 코퍼스의 단 12%만을 OctoLong 데이터로 대체하는 것만으로도 장거리 검색(Long-range retrieval), 장기 상태 추적(Long-term state tracking), 리포지토리 수준의 코드 이해(Repository-level code understanding), 그리고 다운스트림 에이전트 작업(Downstream agentic tasks)에서 상당한 이득을 얻었으며, 동시에 숏 컨텍스트(Short-context) 코딩 시나리오에서의 API 사용 능력도 향상시켰음을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기