Dust: 역전파(Backpropagation) 없이 트랜스포머 사전 학습하기
요약
본 논문은 트랜스포머 언어 모델 사전 학습 시 역전파(Backpropagation)를 대체하는 최초의 제로차(zeroth-order) 방법을 'Dust'를 제시합니다. Dust는 각 토큰을 독립적으로 교란하여 순전파만으로 기울기를 평가하며, 이는 컴퓨팅 자원이 풍부할수록 오히려 성능이 향상되는 확장성을 보여줍니다.
핵심 포인트
- 역전파 없이 트랜스포머 사전 학습 가능한 제로차 방법 제시
- Dust는 단일 순전파(forward pass)로 모든 토큰의 기울기 평가 가능
- 컴퓨팅 자원 증가에 따라 성능이 오히려 향상되는 확장성 입증
- 최첨단 ES 방법 대비 수백~수천 배 높은 효율성을 보임

요약 (TL;DR)
- 우리는 트랜스포머 언어 모델을 사전 학습할 때 역전파에 필적하는 최초의 제로차(zeroth-order) 방법을 제시합니다. Dust는 모든 토큰에서 활성화 값(노드 교란, node perturbation)을 독립적으로 교란하며, 따라서 각 토큰은 가상 모집단 구성원이며 단 한 번의 순전파(forward pass)만으로 이들을 모두 병렬로 평가할 수 있습니다. - Dust는 큰 모집단(즉, 훨씬 더 많은 컴퓨팅 파워)에서 역전파를 근사적으로 모방하며, 여러 설정에서는 심지어 초과합니다. 이는 컴퓨팅 자원이 풍부한 환경에서는 역전파를 능가할 수도 있음을 시사합니다. - Dust는 가중치 공간의 ES(Evolutionary Strategy)보다 몇 자릿수 더 효율적입니다. 추정컨대, 1M 토큰부터 Dust는 최첨단 ES 방법인 EGGROLL의 트랜스포머 구현체보다 $10^3$배에서 $10^4$배 더 효율적입니다.
- 제로차 방법은 대규모 네트워크에 확장되지 못할 것이라고 널리 알려져 있습니다. 놀랍게도, 우리는 모델 크기가 클수록 모집단 효율성이 떨어지는 것이 아니라 오히려 높아진다는 것을 발견했습니다: 2억 4300만 개 매개변수(parameter) 모델이 가장 큰 모집단 크기에서 $120 imes$ 더 작은 모델보다 성능이 우수합니다.
- Dust의 기울기 추정치는 모집단이 커짐에 따라 역전파와 더 잘 일치하며, 우리가 테스트하는 모든 규모(최대 1B 토큰)에서 잘 유지되어 있어 확장성 측면에서 고무적입니다.
1 서론
deep learning은 트랜스포머 기반 언어 모델을 포함하여 현대 신경망을 훈련할 수 있는 유일한 신용 할당 알고리즘인 역전파(backprop)를 중심으로 구축되어 왔습니다. 역전파는 미분 가능성(differentiability)을 요구하며 1차 기울기(first-order gradients)를 생성하고, 딥러닝의 아키텍처, 옵티마이저, 하드웨어는 이 제약 조건 주변으로 공동 진화해 왔습니다.
하지만 전 세계적으로 사용 가능한 컴퓨팅 자원이 증가함에 따라, 우리는 미분 가능성(differentiability), 역전파(backprop), 고차원 그래디언트 근사치와 같은 귀납적 편향(inductive biases)에 기반한 것보다 *탐색(search)*에 기반한 더 일반적이고 무식하게 힘을 쓰는 학습 알고리즘을 선호할 수 있습니다. 쓰라린 교훈(Sutton, 2019 Richard S. Sutton. The bitter lesson. http://www.incompleteideas.net/IncIdeas/BitterLesson.html, 2019. Blog post.)은 컴퓨팅 자원과 함께 확장되는 일반적인 방법이 결국 승리한다는 것이며, AlphaGo Zero (Silver et al., 2017 David Silver, Julian Schrittwieser, Karen Simonyan, Ioannis Antonoglou, Aja Huang, Arthur Guez, Thomas Hubert, Lucas Baker, Matthew Lai, Adrian Bolton, Yutian Chen, Timothy Lillicrap, Fan Hui, Laurent Sifre, George van den Driessche, Thore Graepel, and Demis Hassabis. Mastering the game of Go without human knowledge. Nature, 550 (7676): 354–359, 2017. doi: 10.1038/nature24270.)가 명백한 예시입니다. AlphaGo를 인간 데이터로 초기화하는 것이 네트워크가 초기에 더 빠르게 학습하도록 도왔지만, 많은 컴퓨팅 자원과 함께 순수하게 자체 플레이(self-play)한 네트워크가 이를 능가했습니다. 유사하게, 미분 가능성과 역전파는 낮은 컴퓨팅 영역에서는 학습을 효율적으로 만들기 때문에 좋은 귀납적 편향일 수 있지만, 높은 컴퓨팅 영역에서는 작동하는 아키텍처의 범위를 제한합니다. 심지어 한 아키텍처 내에서도 그래디언트 기반 방법은 손실 지형(loss landscape)을 최적으로 탐색하지 못합니다 (Liu et al., 2020 Shengchao Liu, Dimitris Papailiopoulos, and Dimitris Achlioptas. Bad global minima exist and SGD can reach them. In Advances in Neural Information Processing Systems, volume 33, 2020.). 이것은 현재 신경망이 일반화하기 위해 막대한 양의 데이터를 필요로 하는 이유를 설명할 수도 있습니다. 탐색에 기반한 더 유연한 기여 할당(credit assignment) 알고리즘은 훨씬 더 나은 일반화로 나아가는 중요한 단계일 가능성이 높습니다.
본 논문에서 우리는 역전파(Backpropagation)를 분석적 구조에 크게 의존하기보다 무차별 대입 계산(brute-force computation)에 훨씬 더 많이 기반한 학습 알고리즘으로 대체하는 것을 목표로 합니다. 우리는 이것을 Dust라고 부릅니다. Dust는 활성화 값(activations)을 교란시키고, 각 교란이 손실 함수를 얼마나 낮추는지에 따라 보상을 부여하며, 이 보상 가중치화된 교란들을 집단(population)에 걸쳐 평균화하여 기울기(gradient)를 추정하는 제로차수 최적화 알고리즘입니다. 가중치를 교란시키는 전통적인 ES 방법들(Salimans et al., 2017Tim Salimans, Jonathan Ho, Xi Chen, Szymon Sidor, and Ilya Sutskever. Evolution strategies as a scalable alternative to reinforcement learning. arXiv preprint arXiv:1703.03864, 2017.), EGGROLL(Sarkar et al., 2025Bidipta Sarkar, Mattie Fellows, Juan Agustin Duque, Alistair Letcher, Antonio León Villares, Anya Sims, Clarisse Wibault, Dmitry Samsonov, Dylan Cope, Jarek Liesen, Kang Li, Lukas Seier, Theo Wolf, Uljad Berdica, Valentin Mohl, Alexander David Goldie, Aaron Courville, Karin Sevegnani, Shimon Whiteson, and Jakob Nicolaus Foerster. Evolution strategies at the hyperscale. arXiv preprint arXiv:2511.16652, 2025.)와 같이 집단에 따라 확장되지만, 집단을 확장하는 것은 각 멤버를 구체화하고 평가해야 하므로 비용이 많이 듭니다. 우리는 *가상 집단(virtual population)*이라는 개념을 통해 이 두 가지 비용을 제거합니다. 이 방식은 가중치 공간 자체를 우회하여 모든 멤버를 구체화하는 것을 피하고, 대신 노드 교란(node perturbation)(Werfel et al., 2003Justin Werfel, Xiaohui Xie, and H. Sebastian Seung. Learning curves for stochastic gradient descent in linear feedforward networks. In Advances in Neural Information Processing Systems, volume 16, 2003.; Widrow and Lehr, 1990Bernard Widrow and Michael A. Lehr. 30 years of adaptive neural networks: Perceptron, Madaline, and backpropagation. Proceedings of the IEEE, 78 (9): 1415–1442, 1990. doi: 10.1109/5.58323.)에서처럼 활성화 값을 교란시키는 것입니다. 우리는 이를 모든 토큰에 대해 독립적으로 수행하므로, 각 토큰이 하나의 멤버가 되고 단 한 번의 순전파(forward pass)로 이들을 모두 병렬로 평가할 수 있습니다.
활성화 값(Activations)은 가중치(weights)보다 탐색하기에 더 흥미로운 공간입니다. 메커니즘 해석 가능성(Mechanistic interpretability) 연구는 추론(reasoning)이 언어 모델의 활성화 값 안에 존재하며, 이는 명시적으로 표현 가능한 형태든 아니든 상관없음을 보여주었습니다 (Gurnee et al., 2026Wes Gurnee, Nicholas Sofroniew, Adam Pearce, Mateusz Piotrowski, Isaac Kauvar, Runjin Chen, Anna Soligo, Paul Bogdan, Euan Ong, Rowan Wang, Ben Thompson, David Abrahams, Subhash Kantamneni, Emmanuel Ameisen, Joshua Batson, and Jack Lindsey. Verbalizable representations form a global workspace in language models. arXiv preprint arXiv:2607.15495, 2026.; Lindsey et al., 2025Jack Lindsey, Wes Gurnee, Emmanuel Ameisen, Brian Chen, Adam Pearce, Nicholas L. Turner, Craig Citro, et al. On the biology of a large language model. Transformer Circuits Thread, 2025.). 이는 이 접근 방식이 학습(training)을 잠재적인 추론 탐색으로 바꿀 수 있음을 의미합니다 (Vegesna and Dahal, 2025Akshay Vegesna and Samip Dahal. Decoupling search and learning in neural net training. arXiv preprint arXiv:2509.10973, 2025.). 우리는 활성화 공간의 교란(perturbation)을 매우 일반적인 기여도 할당 규칙(credit assignment rule)과 결합합니다. 이 규칙은 트랜스포머 블록 내의 서로 다른 레이어 유형에 서로 다른 토큰 수준의 보상(reward)을 할당합니다. 이러한 두 가지 편향(biases)과 몇 가지 구현 세부 사항 및 간섭 방지 같은 효율성 측정 방법이 전체 알고리즘입니다.
우리는 다음과 같은 기여를 합니다.
우리는 트랜스포머 언어 모델을 사전 학습할 때 역전파(Backpropagation)와 경쟁할 수 있는 최초의 제로차수(zeroth-order) 방법을 제시합니다. 대규모 모집단에서 Dust는 여러 설정에서 Backprop을 능가하며, 이는 컴퓨팅 자원이 풍부한 환경에서는 Backprop을 뛰어넘을 수 있음을 시사합니다.
Dust는 가중치 공간에서의 ES보다 몇 자릿수(orders of magnitude) 더 효율적입니다. 1M 토큰부터 Dust는 추정치를 기반으로 할 때 EGGROLL의 트랜스포머 구현보다 $10^3$에서 $10^4$배 더 효율적입니다.
전통적인 통념과는 달리, 더 큰 모델이 덜 효율한 것이 아니라 종종 더 많은 모집단 효율성을 가지며 더 큰 모집단을 활용할 수 있습니다. 이는 과매개변수화(overparameterization)에 대한 새로운 관점을 제공하며, 잠재적으로 더 나은 기하학적 구조를 가진 더 큰 탐색 공간으로 간주할 수 있게 합니다.
Dust의 기울기 추정치는 모집단이 커짐에 따라 Backprop과 더 잘 일치하며, 이 정렬은 우리가 테스트하는 모든 규모, 즉 1B 토큰까지 유지되어 확장성 측면에서 고무적입니다.
본 논문의 목표는 역전파(Backpropagation)와 경쟁할 수 있는 검색 기반의 기여 할당 알고리즘을 구축하여, 우리가 생각할 수 있는 가장 어려운 작업, 즉 트랜스포머 사전 학습에 적용하는 것입니다. 우리는 오늘날 Backprop을 대체할 만큼 컴퓨팅 효율적이라고 만들려고 시도하지 않습니다. 또한 외부 프로그램이 루프 안에 있거나(external program in the loop), 시간이 지남에 따라 여러 단계로 루프되는 트랜스포머와 같이 새로운 종류의 신경망을 훈련하는 것도 하지 않습니다. 이 두 가지는 향후 연구에 맡깁니다.
2 방법
Dust는 다음과 같이 작동합니다. 각 선형 레이어의 출력에 가우시안 노이즈를 추가하고, 모든 토큰마다 독립적으로 순전파(forward pass)를 실행한 다음, 해당 토큰에서 발생하는 손실 변화량만큼 각 토큰의 노이즈에 보상을 부여합니다. 이 보상 가중치 노이즈는 드로우(draws)에 걸쳐 평균화된 값으로, 레이어 출력에서의 추정 오차이며, 이것을 레이어 입력과 외적(outer product)하면 가중치 기울기(weight gradient)가 됩니다. 어텐션 내부 구조물은 이와 변형된 방식으로 처리됩니다. 즉, 토큰의 손실에 직접적으로 기여하는 대신, 현재 및 미래 토큰에 걸친 어텐션 출력에서의 추정 오차를 통해 공로를 인정받습니다. 핵심 직관은 가중치 공간(weight-space) ES가 순전파당 하나의 개체군 구성원(population member)을 평가하는 반면, 우리는 모든 토큰마다 병렬적으로 하나씩 평가한다는 것입니다. 그리고 이 구성원은 은닉 상태에 노이즈를 추가함으로써 구현되는데 이는 비용이 저렴합니다. 따라서 최신 트랜스포머에서 단일 순전파는 가중치 공간 ES가 평가할 수 있는 것보다 최소 세 자릿수 더 큰 개체군을 평가하게 됩니다. 각 구성 요소는 아래에서 자세히 설명하겠습니다.
2.1 활성화 공간 교란(Activation-Space Perturbation)
진화 전략(evolution strategies)의 병목 현상은 개체군 크기입니다. 모든 구성원은 가중치의 자체 교란된 복사본과 자체 순전파를 필요로 합니다. EGGROLL (Sarkar et al., 2025Bidipta Sarkar, Mattie Fellows, Juan Agustin Duque, Alistair Letcher, Antonio León Villares, Anya Sims, Clarisse Wibault, Dmitry Samsonov, Dylan Cope, Jarek Liesen, Kang Li, Lukas Seier, Theo Wolf, Uljad Berdica, Valentin Mohl, Alexander David Goldie, Aaron Courville, Karin Sevegnani, Shimon Whiteson, and Jakob Nicolaus Foerster. Evolution strategies at the hyperscale. arXiv preprint arXiv:2511.16652, 2025.)은 저랭크 교란(low-rank perturbations)을 사용하여 복사본을 저렴하게 만들지만, 여전히 각 구성원은 배치(batch)의 하나의 시퀀스 요소이므로 개체군은 감당할 수 있는 순전파에 의해 제한됩니다. 우리는 대신 활성화 값(activations)을 모든 토큰마다 독립적으로 교란합니다.
해당 토큰에서 네트워크는 활성화 값을 생성한 레이어의 가중치에 저랭크 교란(low-rank perturbation)이 적용된 것처럼 작동하지만, 실제로는 그 교란이 가중치에 구현되지 않습니다. 우리는 이것을 *가상 개체군(virtual population)*이라고 부릅니다. 트랜스포머 내의 시퀀스는 수천 개의 토큰을 가지므로, 한 번의 순전파(forward pass)는 하나의 값 대신 시퀀스당 수천 개의 멤버를 평가합니다. 모델의 모든 가중치는 이렇게 훈련되지만, $2L$개의 잔차 혼합 스칼라(residual mixing scalars)는 일반적인 가중치 공간 ES(Evolutionary Strategy)로 훈련됩니다.
가중치가 아닌 활성화 값에 노이즈를 추가하는 것은 노드 교란(node perturbation)이며 (Widrow and Lehr, 1990; Bernard Widrow and Michael A. Lehr. 30 years of adaptive neural networks: Perceptron, Madaline, and backpropagation. Proceedings of the IEEE, 78 (9): 1415–1442, 1990. doi: 10.1109/5.58323.), 이를 지지하는 일반적인 논거는 차원성(dimensionality)입니다 (Ren et al., 2023; Mengye Ren, Simon Kornblith, Renjie Liao, and Geoffrey Hinton. Scaling forward gradient with local losses. In International Conference on Learning Representations, 2023.; Werfel et al., 2003; Justin Werfel, Xiaohui Xie, and H. Sebastian Seung. Learning curves for stochastic gradient descent in linear feedforward networks. In Advances in Neural Information Processing Systems, volume 16, 2003.). 레이어의 출력은 $d_{ ext{out}}$개의 항목을 갖고 가중치는 $d_{ ext{out}} imes d_{ ext{in}}$이므로, 활성화 노이즈는 훨씬 더 작은 공간에 존재합니다. 순진하게 생각하면, 차원성 논거는 많은 토큰에 걸쳐 큰 활성화 값을 가진 트랜스포머에는 적용되지 않습니다. 하나의 시퀀스에 대한 노이즈는 $T imes d_{ ext{out}}$ 텐서이며, 이는 $T imes d_{ ext{out}} imes d_{ ext{in}}$의 가중치 행렬만큼 많은 항목을 갖게 됩니다 (단, $T ext{가 } d_{ ext{in}} ext{보다 크거나 같을 때}$). 하지만 토큰별 독립적인 교란과 보상을 사용하면, 활성화 값을 교란하는 것이 배치 축(batch axis)이 이미 의존하고 있는 것과는 *직교(orthogonal)*한 새로운 효율적인 개체군을 토큰 축(token axis)을 따라 제공합니다.
2.2 기여도 할당 (Credit Assignment)
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기