
지식 주입을 위한 새로운 스케일링 법칙 (New scaling laws for knowledge injection)
요약
사실적 말뭉치로부터 LoRA 어댑터를 생성하는 하이퍼네트워크(Hypernetworks)가 기존의 LoRA 및 전체 미세 조정보다 우수한 일반화 성능을 보인다는 연구 결과입니다. 모델의 규모가 커질수록 이러한 성능 격차는 더욱 확대되는 스케일링 법칙을 제시합니다.
핵심 포인트
- 하이퍼네트워크 기반 LoRA 어댑터 생성 방식 제안
- 분포 외 일반화(OOD) 측면에서 기존 미세 조정 방식보다 우수
- 타겟 모델의 파라미터 규모가 커질수록 성능 격차 확대
사실적 말뭉치 (fact corpus)로부터 LoRA 어댑터를 생성하는 하이퍼네트워크 (Hypernetworks)가 분포 외 일반화 (out-of-distribution generalization) 측면에서 LoRA 미세 조정 (LoRA fine-tuning) 및 전체 미세 조정 (full fine-tuning)보다 우수한 성능을 보이며, 타겟 모델이 커질수록 그 격차는 더욱 벌어집니다. https://t.co/XEyqnMWWAP
[IMG:1]
AI 자동 생성 콘텐츠
본 콘텐츠는 X @huggingpapers (검증됨)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기