
SWE-Pruner Pro: 코딩 LLM은 무엇을 가지치기해야 할지 이미 알고 있다
요약
SWE-Pruner Pro는 코딩 에이전트의 내부 표현을 활용하여 도구 출력의 컨텍스트를 효율적으로 가지치기하는 기술입니다. 별도의 분류기 없이 에이전트 자체의 인코딩을 사용하여 토큰을 최대 39% 절약하며 작업 품질을 유지합니다.
핵심 포인트
- 에이전트 내부 표현을 활용한 직접적인 컨텍스트 가지치기 구현
- 프롬프트 및 완료 토큰을 최대 39%까지 절약 가능
- 추론 오버헤드를 최소화하면서 작업 품질 보존
- SWE-Bench Verified 해결률 및 Oolong 정확도 향상 입증
코딩 에이전트(coding agents)를 위한 긴 컨텍스트 가지치기(Pruning long context)는 효율적인 컨텍스트 관리를 위한 필수적인 기술이 되어 왔습니다. SWE-Pruner와 같은 기존의 컨텍스트 가지치기(context pruning) 방법들은 별도의 코드 분류기(code classifier)를 부착하여 이를 구현하지만, 우리는 에이전트 자체가 도구 출력(tool output)을 읽을 때 코드 컨텍스트의 관련성을 나타내는 내부 표현(internal representations)을 인코딩한다는 것을 발견했습니다. 이러한 발견을 바탕으로, 우리는 에이전트 내부에서 직접 도구 출력을 가지치기하는 SWE-Pruner Pro를 제안합니다. 구체적으로, 작은 헤드(small head)가 에이전트 자체의 내부 표현을 각 라인에 대한 유지 또는 가지치기(keep-or-prune) 레이블로 변환하며, 이때 각 도구 출력의 라인 수에 맞춰 키가 지정된 길이 인식 임베딩(length-aware embedding)을 사용합니다. 두 개의 오픈 웨이트(open-weight) 백본과 네 개의 멀티 턴(multi-turn) 벤치마크를 통해 테스트한 결과, SWE-Pruner Pro는 제한된 추론 오버헤드(inference overhead)를 유지하면서도 작업 품질을 보존하며 프롬프트(prompt) 및 완료(completion) 토큰을 최대 39%까지 절약합니다. 특히, MiMo-V2-Flash에서 SWE-Pruner Pro는 SWE-Bench Verified 해결률을 +3.8% 높였고, 긴 컨텍스트(long-context) Oolong 정확도를 +2.2 포인트 높였습니다.
arXiv : https://arxiv.org/abs/2607.18213
Full Paper : https://arxiv.org/pdf/2607.18213
GitHub : https://github.com/Ayanami1314/swe-pruner-pro
HuggingFace : Coming soon
submitted by /u/pmttyji [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기