추상 추론 과제에 대한 소형 언어 모델의 체계적 연구
요약
본 연구는 ARC-TGI 벤치마크를 사용하여 소형 언어 모델의 추상 그리드 변환 능력과 일반화 성능을 체계적으로 분석했습니다. 지도 미세 조정된 다양한 모델 계열(decoder-only, encoder-decoder, MoE)을 프로파일링한 결과, 인-분포 정확도는 높았으나 훈련 분포 외부에서는 성능이 급격히 저하되는 한계를 확인했습니다.
핵심 포인트
- 추상 추론 능력은 최적화에 민감하며 과제 전반에 걸쳐 고르게 나타나지 않음.
- 훈련 분포를 벗어난 환경(예: 그리드 크기 변경)에서는 성능이 급격히 저하됨.
- 모델 계열 및 적응 방식에 따라 인-컨텍스트 예시의 효과가 다름.
- 실행 가능한 규칙 유도 능력은 직접적인 그리드 생성에서 관찰되지 않음.
추상 추론 벤치마크에서의 엔드포인트 정확도는 특정 언어 모델이 전이 가능한 규칙을 습득했는지 아니면 분포 특이적인 정규성을 맞췄는지를 보여주지 못합니다. 우리는 ARC-TGI 벤치마크에서 이 구분을 소형 언어 모델에 대해 연구했습니다. 이 벤치마크는 추상 그리드 변환을 제어 가능한 과제 가족으로 구성하고, 리샘플링(resampling), 공간 이동(spatial shifts), 그리고 크로스-벤치마크 전이(cross-benchmark transfer)를 지원합니다. 1,000회 이상의 실행에 걸쳐, 우리는 지도 미세 조정(supervised fine-tuning) 하에서 디코더 온리(decoder-only), 인코더-디코더(encoder--decoder), 그리고 전문가 혼합(mixture-of-experts) 모델 계열을 프로파일링했습니다. 우리는 기술 습득의 효율성과 안정성, 훈련 분포를 넘어서는 강건성(robustness), 모델 계열 및 과제 공식화와의 상호작용, 그리고 행동적 차이를 동반하는 레이어별 어텐션 시그니처를 검토합니다. 상당한 인-분포 정확도는 달성 가능하지만, 습득은 최적화에 민감하며 과제 가족 전반에 걸쳐 고르게 분포되어 있지 않습니다. 규칙이 유지되더라도 그리드 크기가 변경될 때를 포함하여, 훈련 분포 외부에서는 성능이 급격히 저하됩니다. 더 깊고 넓은 훈련 세트는 불균일한 이득을 가져오며, 추가적인 인-컨텍스트 예시의 효과는 모델 계열에 따라 다릅니다. 실행 가능한 규칙 유도(executable-rule induction) 역시 직접적인 그리드 생성 하에서는 관찰되지 않았던 정답 솔루션을 제공합니다. 선택된 과제에서 어텐션 진단은 뚜렷한 집중 및 컨텍스트 의존성 프로필을 보여주지만, 일반적인 인과적 메커니즘을 확립하지는 못했습니다. 전반적으로, 추상 추론 점수는 모델, 적응 체제(adaptation regime), 평가 분포, 그리고 응답 형식에 따라 조건적입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기