대규모 데이터 스케일에서의 시퀀스 가중치 연구
요약
본 연구는 사내 개발 모델과 오픈 웨이트 LLM 전반에 걸쳐 데이터 가중치 스케일링 법칙을 분석했습니다. 그 결과, 모델 규모 변화에 따라 학습 패턴이 '데이터 독립적 일반 패턴'에서 '데이터 특정 패턴'으로, 다시 '데이터 독립적 모든 패턴'으로 비단조롭게 전환됨을 발견했습니다.
핵심 포인트
- 모델은 소규모-중규모 구간에서 데이터 가중치에 비례한 특정 패턴 학습 경향을 보입니다.
- 중규모-대규모로 넘어갈 때 다시 데이터 가중치와 무관하게 모든 패턴을 학습하는 능력을 회복합니다.
- 데이터 혼합(data mixing) 방식의 스케일링 행동은 예측하기 어려운 '이상(aberrant)'한 특성을 가질 수 있습니다.
요약: 우리는 사내 개발 모델(in-house)과 오픈 웨이트 대규모 언어 모델(LMs) 전반에 걸쳐 데이터 가중치의 스케일링 법칙을 연구했으며, 규모에 따라 비단조로운 행동을 발견했습니다.
우리는 훈련 중 시퀀스에 할당되는 가중치를 변화시키고, 특정 시퀀스에 대한 모델의 손실 감소가 해당 시퀀스의 가중치에 얼마나 강하게 의존하는지 측정합니다.
종합적으로 볼 때, 우리의 결과는 일반적인 추세와 일치합니다. 즉, 모델이 소규모에서 중규모로 전환될 때는 데이터 가중치와 독립적인 일반 패턴을 학습하는 것에서 데이터 가중치에 비례하여 데이터 특정 패턴을 학습하는 것으로 전환됩니다.
그리고 모델이 중규모에서 대규모로 전환될 때는 다시 한번 데이터 가중치와 무관하게 데이터에 존재하는 모든 패턴을 학습할 수 있게 됩니다.
신경망(neural networks)을 훈련할 때, 우리는 모델이 정확히 무엇을 배우기를 원하는지에 대해 많은 시간을 할애합니다.
우리가 모든 코딩 작업 전반에 걸쳐 일반적으로 지능적이기를 바라는 것과 OCaml에 특별히 능숙하기를 바라는 것 중 어느 것에 더 신경 써야 할까요?
오래된 시장 국면의 데이터가 최근 수집된 데이터와 비교하여 얼마나 유용한가요?
일반적으로, 모델이 모든 것에서 학습하도록 허용하는 것보다 고품질 데이터를 가중치 부여(upweight)하는 것을 얼마나 원할까요?
이러한 질문들은 궁극적으로 데이터 혼합에 관한 질문이며, 우리의 모델의 표현 능력과 FLOPs를 어떻게 어디에 사용할지에 대한 질문입니다.
이러한 질문들을 더욱 복잡하게 만드는 것은 실제로는 우리가 실행하고 싶은 많은 실험들이 엄청나게 비싸다는 점입니다.
심지어 중규모에서도 하이퍼파라미터(hyperparameters)에 대한 조밀한 다차원 그리드 검색(dense multi-dimensional grid search)을 수행하는 것은 불가능하며, 대규모에서는 더욱 그렇습니다 (여기서는 주어진 작업에 대해 하나의 모델만 훈련할 수 있을 수도 있습니다).
이에 대한 표준 접근 방식은 스케일링 법칙(scaling law) 접근 방식을 통해 데이터 혼합 가중치와 같은 하이퍼파라미터를 피팅하는 것입니다. 이 방법에서는 소규모에서 하이퍼파라미터를 피팅한 다음, 이를 더 큰 규모로 외삽(extrapolate)합니다 (가장 대표적인 예는 Chinchilla 스케일링입니다).

스케일링 법칙(scaling laws)의 핵심 과제는 외삽(extrapolation)이 성립하려면 대규모 모델이 (a) 스케일에 불변하거나 (예: MuP 스타일 결과처럼 많은 하이퍼파라미터 최적값이 스케일 전반에 걸쳐 안정적인 경우) 또는 (b) 작은 스케일에서의 행동 변화를 외삽하여 예측 가능해야 한다는 것입니다 (예: Kaplan 스타일 결과처럼 손실(loss)이 스케일에 따라 예측 가능하게 감소하는 경우).
불행하게도 모든 행동이 이러한 특성을 가지고 있는 것은 아닙니다. 일부 행동은 규모에서 출현하며 스케일링 법칙을 통해 예측할 수 없습니다.
본 게시물에서는 이러한 예측 불가능한 스케일링 행동을 *이상(aberrant)*하다고 부르겠습니다.
저희 내부 실험 결과, 데이터 혼합(data mixing)은 이상 스케일링 행동에 특히 취약한 설정임이 밝혀졌습니다. 이는 MAI-Thinking-1 기술 보고서(section 2.5.2)의 발견과 유사한데, 코드 중심 데이터와 STEM 중심 데이터를 혼합하여 학습할 때 모델 크기가 증가함에 따라 품질 순위가 역전되었기 때문입니다. 따라서 저희는 언어 모델이 실제로 데이터 혼합에서 해당 데이터에 할당된 가중치에 비례하여 패턴을 얼마나 학습하는지, 그리고 그 행동이 스케일에 걸쳐 어떻게 변화하는지를 정확하게 특성화하고자 했습니다.
데이터 혼합 실험은 코퍼스 내 데이터의 가중치 효과를 다른 중요하지만 다른 고려 사항과 혼동할 수 있습니다. 가장 주목할 만한 점은, 데이터 혼합 실험 결과가 서로 다른 소스 간의 데이터 품질 변화와 주어진 데이터 소스에서 주변 토큰(marginal tokens)의 고유성 차이에 의해 크게 영향을 받는다는 것입니다.
혼합 가중치(mix weight)만의 효과를 분리하기 위해, 본 게시물에서는 *데이터 가중치 부여(data weighting)*를 특별히 분석합니다. 이는 데이터 혼합의 한 변형으로, 훈련 데이터셋의 각 개별 시퀀스에 손실(loss)에서 서로 다른 가중치를 부여하는 방식입니다.
저희는 먼저 데이터셋의 각 시퀀스에 임의의 *시퀀스 가중치(sequence weights)*를 할당하고, 이 데이터셋으로 모델을 훈련시킨 다음, 동일한 훈련 데이터셋으로 재평가함으로써 모델이 주어진 가중치를 가진 훈련 시퀀스를 얼마나 학습했는지 그 정도를 측정합니다.
다음으로, 우리는 *유효 시퀀스 가중치 지수(effective sequence weight exponent)*라는 측정 기준을 정의합니다 (표기: $\alpha$). 이 지수는 특정 시퀀스의 가중치가 모델이 해당 시퀀스에서 기대하는 손실 감소량에 얼마나 근접하게 비례하는지를 측정합니다. 예를 들어, $\alpha=1$은 모델의 기대 손실 감소량이 시퀀스 가중치에 직접적으로 비례한다고 말하며, $\alpha=0$은 모든 가능한 시퀀스 가중치에 대해 모델의 기대 손실 감소량이 동일하다고 말합니다.
이전 연구들은 스케일링 방식에 대해 혼합된 예측을 내놓았습니다: (Byrd & Lipton 2019)와 대규모 보간(large-scale interpolation) 현상에 대한 일반적인 예측은 더 큰 모델들이 $\alpha=1$로 점근한다고 예상하는 반면, Li et al. 2026은 고정된 토큰당 파라미터 수에서 가치 있는 도메인에 대한 최적의 토큰 반복 횟수가 모델 크기에 따라 완만하게 증가한다는 것을 발견했습니다. 우리는 다음과 같은 질문을 던집니다: 유효 시퀀스 가중치 지수는 스케일에 따른 부드러운 거듭제곱 법칙(power law)인가, 아니면 이탈적인가?
우리는 내부 텍스트 기반 벤치마크에서 시퀀스 가중치의 영향을 평가합니다. 모델 패밀리와 스케일을 아울러 테스트하기 위해, 우리는 수천만 개부터 수백억 개의 파라미터에 이르기까지 범위의 두 가지 사내 사전 학습 LLM(LLMs) 패밀리와 500M에서 72B 파라미터 범위의 오픈 가중치 모델 패밀리(Qwen 2.5)를 평가합니다.
우리는 여러 이탈적인 스케일링 행동(스케일에 걸친 데이터 혼합에 대한 추론은 복잡합니다!)과 몇 가지 주목할 만한 경향을 발견했습니다. 종합적으로 볼 때, 우리의 결과는 유효 시퀀스 가중치 지수가 비단조적 상승 후 하락하는 패턴과 일관됩니다: 소규모 모델들은 작은 유효 시퀀스 가중치 지수에 적합하며, 데이터 가중치와 무관하게 전체 데이터셋에 걸친 학습 패턴을 보입니다; 중규모 모델들은 더 큰 유효 시퀀스 가중치 지수에 적합하며, 데이터 가중치에 비례하여 데이터 내의 패턴을 학습합니다. 대규모 모델들은 다시 작은 유효 시퀀스 가중치 지수에 적합하며, 가중치와 관계없이 데이터에 존재하는 모든 패턴을 학습합니다. 에포크(Epoching)는 유효 시퀀스 가중치 피크를 더 작은 모델 쪽으로 이동시킵니다.
이상한 스케일링 법칙(Aberrant scaling laws)은 저희 모델 훈련 방법론에 불편함을 주지만, 이를 식별함으로써 잘못된 외삽(extrapolations)을 피할 수 있게 합니다.
저희의 과학 분야에서는 이러한 이상 행동에 대해 경계하며, 발견하는 즉시 스케일링 실험 및 평가를 재설계하여 예측 가능하게 만듭니다.¹
저희의 실험은 몇 가지 가능한 해결책들을 제시합니다. 충분히 큰 모델에서만 데이터 혼합(data-mix) 결과를 평가하고 외삽하는 것부터, 관찰된 현상을 보상하기 위해 훈련 가중치(training weights)를 조정하는 것까지 다양합니다.²
그리고 저희는 모델이 예측과 얼마나 벗어나는지를 계속 측정하여, 스케일링 법칙이 무너지는 다음 지점을 포착하고, 훨씬 더 큰, 더 나은 모델을 더욱 높은 확신을 가지고 훈련할 수 있도록 합니다.
방법론 (Methodology)
데이터셋 (Dataset).
저희는 내부 텍스트 벤치마크에서 시퀀스 가중치(sequence weighting)가 미치는 영향을 평가합니다.
이 데이터셋에서는 0.01과 10 사이의 로그 균일 분포(log-uniform)로 추출된 시퀀스 가중치를 사용하여 시퀀스를 가중 처리합니다.
저희는 3 에포크(Epochs) 동안 훈련하고 매 에포크마다 평가를 수행합니다.
모델 (Models). 이 데이터셋에서 세 가지 다른 모델 계열을 평가합니다:
JS-dense: 9개의 모델로 구성된 사내 사전 훈련 밀집 언어 모델(LMs) 계열
JS-sparse: 8개의 모델로 구성된 사내 사전 훈련 Mixture-of-Experts (MoE) LMs 계열
Qwen 2.5: 500M 파라미터부터 72B 파라미터까지의 범위에 있는 오픈 가중치(open-weight) 밀집 LMs 계열.
JS-dense와 JS-sparse 모델은 수천만 개에서 수백억 개의 파라미터에 이릅니다. 모든 상황에서, 이러한 모델들은 규모가 커질수록 홀드아웃 성능(held-out performance)이 증가한다는 점에 유의하십시오.
시퀀스 가중치의 효과 측정 (Measuring the effect of sequence weighting).
먼저 저희는 훈련 데이터셋(각 시퀀스가 $ ext{w}_i$로 가중 처리됨)으로 모델을 훈련시킨 후, 해당 훈련 데이터셋에서 모델을 재평가하고, 각 시퀀스에 대해 훈련을 통해 달성된 손실 감소량(loss reduction)을 측정합니다.
그런 다음 주어진 시퀀스의 가중치와 함께 있는 손실 감소량이 $ ext{w}_i imes ext{l}_i$로 가장 잘 설명되는 $ ext{f}$를 찾습니다.
이 부분은 첨부된 노트에서 더 정확하게 다루겠지만, 서로 다른 값들이 무엇을 의미하는지 더 잘 이해하기 위해 몇 가지 시나리오를 살펴보겠습니다:
- 시퀀스에 대한 예상 손실 감소량이 해당 가중치와 무관합니다 (즉, 높은 가중치를 가진 시퀀스의 손실을 낮은 가중치를 가진 시퀀스보다 더 줄이지 않습니다).
- 가중치가 높은 시퀀스는 가중치가 낮은 시퀀스보다 더 많은 손실 감소를 경험하지만, 그 감소는 지수(exponent)에 따라 준선형적으로 변화합니다 (즉, 손실 감소량은 해당 훈련 가중치에 비례합니다).
- 가중치가 높은 시퀀스는 시퀀스 가중치로 암시하는 것보다 더 집중적인 방식으로 낮은 가중치의 시퀀스보다 많은 손실 감소를 경험합니다 (예: 모델이 가장 높은 가중치를 가진 시퀀스를 암기하고 다른 모든 행에 대해 무작위 예측을 샘플링했다면, 우리는 [IMG:N]를 보게 될 것입니다).
하이퍼파라미터(Hyperparameters).
우리는 검증 세트(validation set)를 기준으로 손실을 최소화하도록 하이퍼파라미터를 조정합니다.3
가장 큰 사내 모델들은 하이퍼파라미터를 경제적으로 조정하기에는 너무 크기 때문에, 우리는 Chinchilla 스타일의 파워 법칙 스케일링 법칙(power law scaling law)을 통해 하이퍼파라미터를 설정하고 규모에 따른 최적의 하이퍼파라미터 함수를 도출합니다.
결과 및 분석

다음은 각 모델 패밀리별 상호작용하는 3D 표면도입니다:
주어진 모델 패밀리와 에포크(epochs) 수 내에서, 일반적으로 작은 규모에서는 (특히 수백억 개의 파라미터에 이르기까지) 증가하다가 수천억 개 파라미터 영역에 가까워지면서 더 큰 규모에서는 감소하는 경향을 보입니다 (참고로, 그림에 있는 가장 큰 JS-dense 링은 100B 파라미터 미만입니다).
더 많은 에포크 동안 훈련하면 피크가 더 작은 모델 규모 쪽으로 이동합니다. 모델 패밀리 간에는 –의 실제 값과 관련성이 거의 없다는 것을 발견했습니다. JS-sparse에서 가장 작은 모델은 JS-dense에서 가장 작은 모델보다 상당히 크지만, ; JS-sparse에서 가장 큰 모델 역시 Qwen 2.5에서 가장 큰 모델보다 상당히 크지만, 더 큰 .
왜 때로는 상승하다가 하락할까요? 우리는 이것이 모델들이 데이터에 존재하는 다양한 패턴들을 서로 다른 속도로 학습하기 때문이라고 가설을 세웁니다. 어떤 패턴들은 모든 시퀀스에서 잘 일반화(generalize)되지만(예: 영어 이해), 다른 패턴들은 더 작은 그룹의 시퀀스에 특유한 것들입니다(idiosyncratic). 이 데이터셋에서는 일반적인 패턴들을 학습하여 얻을 수 있는 손실 감소량보다, 특유한 패턴들을 학습하여 얻을 수 있는 손실 감소량이 더 많습니다. 따라서 우리는 작은 모델들이 제한된 용량을 사용하여 일반적인 패턴들을 학습하고 특유한 패턴들을 표현할 수 없으며, 중간 크기 모델들은 일반적이고 가장 중요한 특유한 패턴들(시퀀스 가중치로)을 모두 학습하고, 큰 모델들은 모든 특유한 패턴들을 모든 가중치로 학습할 용량을 가진다고 가설을 세웁니다. 에포킹(Epoching)은 모델이 일반적인 패턴과 특유한 패턴 둘 다를 더 많이 학습하도록 합니다.
더 넓게 보면, 작은 규모에서의 시퀀스 가중치 행동이 가장 큰 규모에서의 행동을 명확하게 예측하지 못한다는 것을 발견했습니다. 이는 너무나 흔한 결과를 잘 보여줍니다. 즉, 큰 모델들은 작은 모델들이 보이는 것과는 종류가 다른 행동을 할 수 있다는 것입니다. 따라서 우리의 스케일링 연구는 곡선 자체를 피팅(fitting)하는 데 쓰는 시간과 노력만큼, 왜 우리가 예측된 곡선에서 벗어나는지 이해하려고 노력하는 데에도 많은 시간과 주의를 기울여야 합니다.
이런 종류의 주제가 흥미로우시다면 지원을 고려해 보세요.
수만 개의 GPU, 페타바이트(petabytes) 규모의 학습 데이터, 그리고 최고의 아이디어에 투자할 수 있는 민첩성과 자원을 갖춘 훌륭하고 지지적인 동료들로 이루어진 긴밀한 그룹에 합류하게 될 것입니다.
*
이러한 비정상적인 스케일링 법칙에 대한 수정의 고전적인 예는 객관식 문제 답변에서 볼 수 있습니다. 작은 규모의 모델들은 종종 샘플링된 응답으로 노이즈 플로어(noise floor) 근처를 맴돌다가, 모델이 지침을 따르는 법을 배우면서 이산적인 점프가 일어나는 경우가 많지만, 답변에 대한 비트-퍼-바이트(bits-per-byte)와 같은 연속적인 메트릭을 측정하면 종종 부드럽고 비정상적인 스케일링을 보여줍니다.
특히, 만약 효과적인 시퀀스 가중치가 $\sim$와 같이 스케일한다면, 목표 손실 감소 가중치를 달성하기 위해서는 감쇠된(damped) 가중치 $\text{e.g., } \sim$를 사용하여 훈련해야 할 수도 있습니다. 우리는 이 가설을 테스트하지 않았습니다.
우리는 모든 경우에 강력한 정규화(heavy regularization)를 적용하여 결과 모델이 별도로 보관된 세트(held-out set)에서 성능을 근사적으로 최대화하도록 합니다. 비록 우리가 이 아키텍처들 중 가장 작은 것들을 제외하고는 첫 번째 패스에서 전체 입력 데이터를 암기할 수 있도록 조정할 수는 있겠지만, 이것은 우리가 관심을 갖는 시나리오를 대표하지 않습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Lobste.rs ML의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기