LESSER: 출력 레이어 기울기를 사용한 파인튜닝 후 데이터 선택
요약
본 논문은 LLM 사후 학습을 위한 데이터 선택의 효율성을 높이는 LESSER라는 방법을 제안합니다. 기존 기울기 기반 데이터 선택 방식은 전체 파라미터에 대한 역전파가 필요해 계산 비용이 매우 컸습니다. LESSER는 출력 레이어 기울기를 사용하여 이 문제를 해결하며, 더 저렴한 순전파만으로도 높은 성능을 유지함을 입증했습니다.
핵심 포인트
- LESSER는 LLM 데이터 선택의 효율성을 높이는 방법론입니다.
- 출력 레이어 기울기 사용으로 계산 비용(FLOP)을 크게 절감합니다.
- SFT 및 RL 벤치마크에서 전체 기울기와 동등한 성능을 보였습니다.
대규모 언어 모델(LLM)의 사후 학습(post-training)을 위한 데이터 선택은 다운스트림 성능에 큰 영향을 미칩니다. 기울기 기반 데이터 선택(Gradient-based data selection)은 훈련 데이터를 작은 검증 세트의 기울기와 얼마나 잘 정렬되는지에 따라 순위를 매기는 인기 있는 접근 방식입니다. 그러나 전체 파라미터 기울기를 사용한 순위 지정은 모든 샘플에 대해 비용이 많이 드는 역전파(backward pass)를 필요로 하므로, 대규모 후보 풀(candidate pool)의 경우 계산이 불가능해집니다. 이는 자연스러운 질문을 제기합니다: 비용의 일부만으로 전체 기울기 특징(full-gradient features)을 근사할 수 있을까? 편리하게도, 우리는 출력 레이어 기울기(output-layer gradients)가 효과적인 데이터 선택에 충분하며, 더 저렴한 순전파(forward pass)만을 필요로 한다는 것을 발견했습니다. 이를 LESSER로 구현했으며, 이는 선택 방법의 드롭인 래퍼(drop-in wrapper)로서 SFT 및 RL 벤치마크에서 특징 추출 FLOP 비용을 $9.7 imes$ 감소시키고 $3.0 imes$ 감소시키는 동시에, 다운스트림 작업에서 전체 기울기 성능을 추적합니다. 경험적으로, 출력 레이어 기울기와 전체 기울기가 개별 샘플의 순위를 다르게 매길 때조차도, 이들은 정렬된 기울기를 가진 배치(batch)를 선택한다는 것을 발견했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기