ISO-AdamW를 사용해봤습니다. AdamW가 제 역할을 다하고 있습니다.
요약
본 기사는 새로운 옵티마이저인 ISO-AdamW를 개발하고, 표준 AdamW와 비교 테스트한 경험을 공유합니다. 1,000문제의 별도 테스트에서 ISO-AdamW가 약간 높은 점수를 기록했으나, 필자는 이 차이가 프로덕션 스택 교체로 이어질 만큼 충분하지 않다고 결론지었습니다. 이는 RL 과정에서의 모델 학습 방식에 대한 알고리즘적 개선을 다루며, 표준 AdamW의 견고함을 강조합니다.
핵심 포인트
- ISO-AdamW는 새로운 옵티마이저이며, 등스펙트럼 다양체(isospectral manifold) 제약을 사용합니다.
- 테스트 결과 ISO-AdamW가 AdamW보다 약간 높은 성능을 보였으나, 그 차이는 미미했습니다.
- 옵티마이저는 손실 기울기를 모델 가중치 업데이트 단계로 변환하는 핵심 엔진입니다.
- 표준 AdamW는 여전히 프로덕션 환경에서 매우 견고하고 효과적인 옵티마이저임을 입증했습니다.
네 가지 답변입니다. 새로운 옵티마이저(optimizer)를 구현하고, 고통스러울 정도로 느린 행렬 연산을 수정하며, 두 버전을 동일한 수학 시험에 돌려본 결과, 차이는 이 정도였습니다: 1,000문제로 구성된 별도 테스트에서 ISO-AdamW는 758개의 정답을 기록했고, 기준 모델인 AdamW는 754개를 기록했습니다.
'새로운 기하학적 옵티마이저가 AdamW를 능가했다! RL 파이프라인을 재작성할 시간!' 같은 더 흥미진진한 헤드라인을 상상하실 수 있을 겁니다. 저희도 명확한 승리를 원했을 것입니다. 강화학습(RL) 과정에서 언어 모델이 학습하는 방식에 대한 알고리즘적 개선은 언제나 축하할 만합니다.
하지만 1,000문제 중 네 개의 답변 차이는 심층적인 시스템 분석을 필요로 했습니다. 이것은 전용 NVIDIA H200 GPU를 사용한 통제된 파일럿 테스트의 경험담이자, 우아한 선형대수학(linear-algebra) 아이디어이며, 왜 우리의 표준 AdamW가 프로덕션 후 학습 단계에서도 제 역할을 하고 있는지에 대한 이야기입니다.
여기서 시작하세요
이 내용을 이해하기 위해 고급 대수학 지식이 필요하지 않습니다. 저희는 무엇을 변경했는지, 두 옵티마이저를 동일한 하드웨어에서 어떻게 벤치마크 했는지, 그리고 왜 약간 높은 점수가 우리의 프로덕션 스택을 교체할 만큼 충분하지 않았는지 설명하겠습니다.
- 옵티마이저(Optimizer): 손실 기울기(loss gradients)를 모델 가중치에 대한 수치적 업데이트로 변환하는 규칙입니다.
- GRPO: Group Relative Policy Optimization: 여러 후보 답변을 생성하고 더 높은 점수를 받은 시도를 강화하는 RL 알고리즘입니다.
- 별도 테스트(Held-out test): 하이퍼파라미터 튜닝 및 초기 체크포인트 선택에서 분리된, 1,000문제로 구성된 깨끗한 테스트 세트입니다.
- Isospectral (ISO): 좌표계를 회전시키기만 하고 특이값(singular values, stretch factors)을 고정하는 수학적 제약 조건입니다.
1. 옵티마이저가 실제로 하는 일은 무엇일까요?
누군가에게 다단계 단어 문제 풀이를 가르치는 것을 상상해 보세요. 문제를 주고, 시도하게 한 다음, 그 결과물을 점수 매깁니다. 그들은 이 피드백을 다음 문제에 대한 더 나은 시도로 바꾸는 체계적인 방법이 필요합니다.
신경 언어 모델은 **가중치(weights)**라고 불리는 수십억 개의 숫자 값을 업데이트함으로써 이러한 작업을 수행합니다. 훈련 중, 손실 함수는 예상 보상을 증가시킬 방향을 나타내는 수학적 기울기(gradient)를 생성합니다. 옵티마이저는 이 기울기를 실제 매개변수 단계로 변환하는 엔진입니다: 어떤 숫자를 얼마나 변경할지 결정합니다.
표준 AdamW는 과거 기울기의 이동 평균(momentum)과 그 제곱 크기(variance)의 실행 이동 평균을 추적하여 모델의 개별 매개변수 각각에 대해 단계 크기를 독립적으로 조정합니다.
이번 실험에서는 학교 수준 수학 단어 문제(GSM8K)에 GRPO (Group Relative Policy Optimization)를 적용했습니다. 이 모델은 후보 완료 그룹을 생성합니다. 엄격한 검증 규칙이 각 최종 숫자 출력을 점수화합니다: 만약 실제 해답이 42라면, 43으로 끝나는 논리적인 다단락 사고 과정(chain of thought)은 정확히 0의 보상을 받습니다.
연구 질문은 간단했습니다: 가중치 업데이트를 등스펙트럼 다양체(isospectral manifold)로 제한하는 것이 제약 없는 좌표별 AdamW보다 더 효과적일 수 있을까?
2. 대수학 없이 ISO 아이디어
유연한 고무 시트에 그려진 점들의 원을 상상해 보세요. 가중치 행렬(weight matrix)을 적용하면 그 원이 타원(ellipse)으로 변환됩니다: 일부 방향은 다른 방향보다 더 늘어나고 좌표 방향이 회전합니다.

SVD는 가중치 행렬을 회전(rotations)과 늘어나는 인자(stretch factors)로 분해합니다. AdamW는 이 둘 다를 변경하지만, ISO-AdamW는 기본 모델의 늘어나는 인자를 유지하고 프레임만 회전시킵니다.
선형 대수학에서 임의의 가중치 행렬 $ ext{W}$는 특이값 분해(Singular Value Decomposition, SVD)를 통해 고유하게 분해될 수 있습니다:
$$ ext{W} = ext{U} ullet ext{ extSigma} ullet ext{V}^{ ext{T}}$$
여기서 $\Sigma$는 **특이값(singular values)**의 대각 행렬(주축을 따른 늘어남 계수)이며, $\mathbf{U}$와 $\mathbf{V}$는 입력 및 출력 특이 프레임(회전 각도)을 나타내는 직교 행렬입니다.
Zhu 등이 발표한 논문 ISO: An RLVR-Native Optimization Stack에서는 강화학습(RL) 과정에서 모델이 사전 학습 동안 수조 개의 토큰을 거치며 이미 습득한 근본적인 표현 능력($ ext{Σ}_0$)을 변경할 필요가 없다고 제안했습니다. 대신, 추론은 좌표 프레임($ ext{U}, ext{V}$)을 재정렬하는 것만으로 충분합니다:
$ ext{W}(t) = ext{U}(t) \cdot ext{Σ}_0 \cdot ext{V}(t)^T$
ISO-AdamW를 사용하면, AdamW는 개별 원시 가중치 항목을 직접 업데이트하는 대신 프레임 방향을 업데이트합니다. 각 최적화기 단계(optimizer step) 후에는 직교화(orthogonalization) 단계를 통해 프레임을 다시 직교 행렬의 다양체(manifold)로 투영합니다. 근본적인 가중치는 여전히 변하지만, 그 특이 스펙트럼은 기본 모델에 영구적으로 고정됩니다.
저희는 이미 RL 과정 중 가중치 스펙트럼 내부에서 무엇이 바뀌는지에 대한 심층 분석에서 이 아이디어의 이론적 토대를 탐구했습니다. 이제는 자체 학습 파이프라인 내에서 그 실제 엔지니어링 동작을 정량화하고 싶었습니다.
3. 두 최적화기 모두에게 공정한 기회를 주기 위해
비교가 경험적이고 기반에 충실하도록, 컴퓨팅 예산을 제한하고 작업량을 고정했습니다:
- 모델:
Qwen/Qwen3-1.7B-Base는 사전 정렬 편향이 없는 깨끗하고 현대적인 기본 모델입니다. - 작업 부하:
openai/gsm8k로, 결정론적 숫자 답을 가진 다단계 산술 단어 문제로 구성되어 있습니다. - 하드웨어 기준선: 전용의 선점 가능 NVIDIA H200 SXM GPU (141 GB HBM3e) 한 대. 두 최적화 도구는 클라우드 변동을 피하기 위해 정확히 동일한 물리적 장비에서 순차적으로 실행되었습니다.
- 학습 기간: 50개의 정책 업데이트(총 400개 완료된 프롬프트 그룹 사용, 모델당)를 수행했으며, 전체 FP32 최적화 상태와 BF16 자동 캐스트 계산을 사용했습니다.
또한 두 최적화 도구 모두가 동일한 학습률을 사용하도록 강제하는 일반적인 벤치마킹 함정을 피했습니다. 구조적으로 다른 수학적 알고리즘에 임의로 공유된 단계 크기를 부과하는 것은 공정한 경쟁을 보장하지 못합니다. 우리는 별도의 128개 질문 검증 테스트에서 각 최적화 도구별로 세 가지 학습률을 스크리닝했습니다:
- AdamW 그리드: 5e-7, 1.5e-6, 3e-6 → 선택: 3e-6
- ISO-AdamW 그리드: 3e-7, 7.5e-7, 2e-6 → 선택: 7.5e-7
하이퍼파라미터가 선택된 후, 두 50단계 파일럿은 정확히 동일한 초기 기본 모델 가중치(SHA256: 24d53e3c...)에서 깨끗하게 재시작되었습니다. 1,000개 질문의 별도 테스트는 학습이 완전히 완료된 후에만 평가되었습니다.
4. 먼저, 실험을 실행 가능하게 만들기: 44× 커널 우회 경로
정확도를 측정하기 전에 심각한 시스템 병목 현상에 직면했습니다. ISO-AdamW의 초기 프로토타입 구현은 H200에서 훈련 단계당 약 170초가 걸렸습니다. 표준 AdamW는 약 7초가 걸렸습니다. 이 속도라면 전체 GPU 예산이 단지 10단계만으로 소진되었을 것입니다.
원인은 직교화(orthogonalization) 단계였습니다. 업데이트된 프레임 행렬을 Stiefel 다양체에 다시 투영하는 과정입니다. 수백 개의 가중치 행렬에 걸쳐 전체 특이값 분해(SVD: Singular Value Decomposition)를 매 단계마다 순진하게 계산하면 GPU 파이프라인이 멈춥니다. 우리는 대안적인 SVD 드라이버를 벤치마킹했지만, 전체 분해는 여전히 비현실적이었습니다.
핵심 시스템 통찰은 연속적인 학습 단계(training steps) 사이에서 직교 프레임(orthogonal frames)이 작은 증분으로만 변화한다는 것이었습니다. 처음부터 전체 SVD를 수행하는 대신, 반복적인 **Newton–Schulz 반복(iterations)**을 사용하여 극 투영(polar projection)을 계산할 수 있습니다:
[X_{k+1}=\frac{2}{1}X_k\left(\frac{3I−X_kT\X_k}{}
ight)]
우리는 엄격한 수치 허용 오차 검사(numerical tolerance check)와 반복이 허용 오차 내에서 수렴하지 않을 경우 자동 SVD 폴백(automatic SVD fallback) 기능을 갖춘 고성능 Newton–Schulz 극 반복을 구현했습니다.
우리는 H200 환경에서 Qwen3-1.7B의 다섯 가지 개별 텐서 기하학(tensor geometries)에 걸쳐 이 백엔드를 검증했습니다:
| 텐서 모양 (Tensor Shape) | 단계당 프레임 수 (Frames / Step) | 네이티브 SVD 지연 시간 (Native SVD Latency) | Newton–Schulz 지연 시간 (Newton–Schulz Latency) | 속도 향상 (Speedup) | 직교성 오차 (Orthogonality Error) |
|---|---|---|---|---|---|
| [1024, 1024] | 56 | 136.3 ms | 34.01 ms | 4.0× | 1.99e-15 |
| ... | |||||
| 이 알고리즘 최적화는 단계당 극 오버헤드(polar overhead)를 142.11초에서 3.20초로 줄였으며, 이는 전체 SVD의 수학적 출력과 $10^{13}$분의 6 이하(상대 오차 < $6.1 \times 10^{-13}$)로 일치합니다. |
[![단계당 394개 프레임 행렬 재직교화: 전체 SVD 사용 시 142초, Warm-started Newton-Schulz 반복 사용 시 3.2초. SVD 시간의 대부분은 197개의 사각 [2048, 2048] 프레임에 소요됩니다.](https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2F9bgcsjswrdpush5ziknh.png)
단계당 394개 프레임 행렬 재직교화: 전체 SVD 사용 시 142초, Warm-started Newton-Schulz 반복 사용 시 3.2초. SVD 시간의 대부분은 197개의 사각 [2048, 2048] 프레임에 소요됩니다.
5. 천 개의 답변 중 네 가지
두 최적화기(optimizer) 모두 실용적인 속도로 작동하며 정확한 체크포인트 재현(checkpoint replay)으로 검증되었으므로, 두 모델을 전체 1,000문제의 비축 GSM8K 테스트 세트에서 평가했습니다:
| Optimizer / Checkpoint | Correct Answers | Accuracy | Delta vs. Base | Mean Solution Length |
|---|---|---|---|---|
| Base Model (Qwen3-1.7B-Base) | 730 / 1,000 | 73.0% | — | — |
| ... |
서류상으로는 ISO-AdamW가 앞섰습니다: 75.8% 대 75.4% (+0.4 퍼센트 포인트). 하지만 개별 문제별로 쌍을 이루는 결과(paired outcomes)를 살펴보면 실제로 무슨 일이 일어났는지 알 수 있습니다:
ISO는 단순히 AdamW의 정답들을 모두 유지하고 네 개의 추가 답안을 더한 것이 아니었습니다. 대신, 64개의 성공 사례를 68개의 다른 성공 사례와 맞바꾼 것입니다.

1,000개의 테스트 문제는 각각 한 칸씩입니다. 두 최적화기는 그중 868문제에 대해서는 의견이 일치하며, ISO-AdamW의 네 개 답안 우위는 나머지 132문제에서 68번 성공하고 64번 실패한 것입니다.
이 격차가 통계적으로 유의미한지 확인하기 위해 20,000회의 쌍을 이루는 문제 부트스트랩 재표본 추출(paired question-bootstrap resamples)을 수행했습니다. 그 결과로 나온 정확도 차이에 대한 95% 신뢰 구간은 −1.8%에서 +2.7% 범위였습니다. 이 구간이 쉽게 0을 가로지르기 때문에, 4문제의 우위는 예상되는 표본 노이즈(sampling noise) 내에 있습니다.
두 모델이 의견을 달리하는 132개 문제에 대해 정확한 McNemar 테스트를 수행한 결과 p 값은 약 0.79였습니다. 심지어 베이스 모델 대비 향상분조차도 애매합니다: AdamW의 +2.4점은 −0.2에서 +5.0 사이의 95% 구간을 가지며, ISO-AdamW의 +2.8점은 +0.1에서 +5.4 범위입니다. 단일 학습 시드(training seed)만으로는 이 차이들 중 어느 것도 '진짜'라고 부를 수 없습니다.

각 간격에 대한 95% paired bootstrap interval. ISO-AdamW와 AdamW의 구간은 0 근처에 중심을 두고 있으며, 심지어 기본 모델 대비 AdamW의 이득마저도 0을 가로지릅니다.
초기 체크포인트 미리 보기의 위험성 (The Peril of Early Checkpoint Peeking)
훈련 중 검증 성능 추적은 또 다른 중요한 교훈을 보여줍니다. 즉, 중간 체크포인트를 너무 일찍 평가할 경우 매우 기만적일 수 있다는 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기