arXiv 논문 발표: "레이어를 건너뛸 것인가, 반복할 것인가? LLM에서의 Program-of-Layers 학습"
요약
LLM의 고정된 레이어 구조를 넘어, 입력에 따라 레이어를 건너뛰거나 반복하여 실행하는 'PoLar(Program-of-Layers)' 기술을 제안합니다. 이를 통해 추론 시간 연산량과 모델의 추론 능력 사이의 유연한 트레이드오프를 달성할 수 있습니다.
핵심 포인트
- 훈련이 필요 없는(training-free) 동적 레이어 실행 방식 제안
- 입력 데이터에 맞춰 레이어를 건너뛰거나 반복하는 프로그램 형성
- 표준 순전파 방식보다 적은 레이어로 더 높은 정확도 달성 가능
- 추론 속도와 품질 사이의 유연한 선택권 제공
이 논문에서 Li, Li, Zhou는 추론 시간 연산량(inference-time compute)을 더 높거나 낮은 추론 능력(inference competence)과 어떻게 교환할 수 있는지를 설명하는 공식 이론을 검토하고, 해당 이론을 몇 가지 친숙한 오픈 웨이트(open-weight) LLM(Llama-3.2, Qwen1.5, Qwen2.5, Qwen3)에 적용합니다: https://arxiv.org/abs/2606.06574v1 > 거대 언어 모델(LLMs)은 모든 레이어의 고정된 깊이와 순서, 비재귀적(non-recurrent) 실행을 따름으로써 추론을 수행합니다. 우리는 사전 학습된(pretrained) 레이어들을 모듈로 묶은 뒤, 각 입력에 대해 맞춤형 프로그램을 형성하도록 건너뛰거나(skip) 반복(loop)할 수 있는, 훈련이 필요 없는(training-free) 유연하고 동적인 "레이어 프로그램(program-of-layers, PoLar)"이 널리 존재함을 밝혀냅니다. 대부분의 입력에 대해, 실질적으로 더 짧은 프로그램 실행으로도 동일하거나 더 나은 정확도를 달성할 수 있으며, 기존 LLM의 잘못된 예측은 더 적은 레이어를 가진 대안 프로그램을 통해 수정될 수 있습니다. 이러한 관찰 결과는 추론이 표준적인 순전파(forward pass)를 넘어 여러 유효한 잠재 연산(latent computations)을 허용함을 나타냅니다. 실제로 PoLar를 효율적으로 구현하기 위해, 우리는 각 입력에 대해 사전 학습된 레이어를 동적으로 건너뛰거나 반복하는 실행 프로그램을 생성하도록 학습하는 경량 PoLar 예측 네트워크를 제안합니다. 수학적 추론 벤치마크에 대한 실험 결과, PoLar는 표준 추론 및 이전의 동적 깊이(dynamic-depth) 방법들보다 종종 더 적은 레이어를 실행하면서도 일관되게 정확도를 향상시키며, 이러한 이점은 분포 외(out-of-distribution) 평가에서도 지속됨을 입증했습니다. 우리의 결과는 고정된 깊이의 실행이 LLM의 잠재적 추론 능력의 좁은 부분집합만을 포착한다는 것을 시사합니다. 이는 로컬 LLM 커뮤니티와 관련이 있는데, 우리의 추론 스택 소프트웨어를 수정하여 추론 시점에 로컬 모델로 이러한 성능/능력 간의 트레이드오프(trade-offs)를 허용할 수 있음을 의미하기 때문입니다. 우리는 빠른 추론이 필요할 때는 더 빠른 추론을 선택할 수 있고, 더 높은 능력이 필요할 때는 더 높은 품질의 추론을 선택할 수 있게 될 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기