우리는 월드 모델(World Model)을 더 작게 만들었고, 결과는 더 좋아졌다. 그 후 '효율적인' 어텐션(Attention)은 아무것도
요약
월드 모델의 스케일링 전략에 있어 깊이(depth)보다 너비(width)를 확장하는 것이 성능과 최적화 측면에서 더 유리할 수 있음을 실험으로 증명했습니다. 실험 결과, 너비 중심 모델은 더 높은 PSNR과 SSIM을 기록하며 더 빠르고 안정적인 학습 수렴을 보였습니다.
핵심 포인트
- 레이어를 깊게 쌓는 것보다 임베딩 및 헤드 차원을 넓히는 것이 최적화에 유리함
- 너비 중심 모델은 더 매끄러운 학습 궤적과 안정적인 그래디언트 노름을 보임
- 이미지 품질(PSNR/SSIM) 향상이 반드시 기하학적 정확도(Depth RMSE) 향상으로 이어지지는 않음
- 전역적 정보 교환이 중요한 작업에서는 파라미터를 너비에 할당하는 것이 효율적임
동일한 월드 모델(World Model)에 대한 두 가지 실험을 진행했으며, 두 실험 모두 제가 예상했던 것과는 정반대의 결과가 나왔습니다. 하나는 현재 IJCNN 2026 논문이며, 다른 하나는 ICPR 2026 논문입니다. 두 실험 모두 본질적으로 같은 문제를 다루고 있습니다. 즉, 우리 대부분이 가지고 있는 스케일링(Scaling)에 대한 직관은 우리가 사용하는 하드웨어보다 더 오래된 것이라는 점입니다.
여기서 월드 모델(World Model)이 해야 할 일
동적 장면 재구성(Dynamic scene reconstruction) 모델은 시간에 따른 희소한 다중 뷰 카메라 관측값(Sparse multi-view camera observations)을 받아, 사물이 어떻게 움직이는지를 포함하여 전체 3D 장면을 예측합니다. 거리의 카메라 몇 대를 2초 동안 비추면, 자동차가 올바르게 움직이는 해당 거리의 3D 표현(3D representation)을 얻을 수 있습니다.
이것은 자율 주행 및 로보틱스를 위한 월드 모델(World Model)의 인지(Perception) 측면입니다. 만약
우리는 너비 중심(width-dominant)의 얕은 변형 모델(shallow variant)을 구축했습니다. 구체적으로는 다음과 같습니다: 더 적은 트랜스포머 레이어(transformer layers), 더 큰 임베딩 차원(embedding dimension), 그리고 더 큰 헤드 차원(head dimension)을 가진 더 적은 어텐션 헤드(attention heads). 그런 다음, 동일한 학습 및 데이터 파이프라인 하에서 더 큰 구성의 표준 베이스라인(standard baseline)에 맞서 더 '작은' 구성으로 모델을 실행했습니다.
| 모델 | PSNR | SSIM | Depth RMSE |
|---|---|---|---|
| STORM 베이스라인 (B8) | 26.82 | 0.770 | 12.59 |
| 우리의 모델, 너비 중심 (V6, S8 구성) | 27.57 | 0.806 | 15.59 |
더 작은 모델로부터 얻은 +0.75 PSNR 및 +0.036 SSIM.
학습 역학(training dynamics)은 더욱 흥미로운 부분이었습니다. 너비 중심 모델은 눈에 띄게 더 매끄러운 궤적을 따라, 더 높은 고원(plateau)에 더 빠르게 수렴했으며, 그래디언트 노름(gradient norms) 또한 실질적으로 더 안정적이었습니다. 이는 어려운 최적화(optimization)의 끝에서 간신히 얻어낸 미미한 승리가 아니었습니다. 단순히 최적화하기가 더 쉬운 모델이었을 뿐입니다.
이것이 타당한 이유는 다음과 같습니다: 셀프 어텐션(self-attention)은 이미 모든 개별 레이어 내에서 전역적 혼합(global mixing)을 제공합니다. 레이어를 더 많이 쌓는 것은 더 많은 순차적 정제(sequential refinement)를 얻게 해주지만, 순차적 깊이(sequential depth)는 바로 최적화를 어렵게 만드는 요소입니다. 반면 너비를 넓히는 것은 전역적 정보 교환을 유지하면서 각 어텐션 헤드에 작업할 수 있는 더 풍부한 표현(representation)을 제공합니다. 어차피 모든 토큰이 다른 모든 토큰과 통신해야 하는 작업에서, 파라미터 예산을 깊이보다는 너비에 할당하는 것은 분명히 틀린 선택이 아니며, 여기서는 옳은 선택이었습니다.
이제 제가 솔직해지고 싶은 부분입니다: Depth RMSE 열을 보십시오. 베이스라인이 기하학적 구조(geometry) 측면에서는 우리의 15.59에 비해 12.59로 명확히 더 우수합니다. 우리는 더 예쁜 이미지를 얻었지만, 깊이(depth)는 더 나빠졌습니다.
그러한 트레이드오프(trade-off)는 실재하며, 우리는 이를 숨기기보다는 하나의 발견(finding)으로서 보고했습니다. 광도 품질(Photometric quality)과 기하학적 정확도(geometric accuracy)는 동일한 축이 아닙니다. 만약 여러분이 디스플레이가 아닌 플래너(planner)에 출력을 제공하는 월드 모델을 구축하고 있다면, 우리가 패배한 그 열이 여러분이 실제로 신경 써야 하는 열일 수도 있습니다. 누군가 "+0.75 PSNR"을 무조건적인 승리로 읽는다면, 그 논문을 잘못 읽은 것입니다.
실질적인 결론은 배포 가능성입니다. 소비자용 GPU로 학습되고 더 큰 모델보다 사진측정(photometric) 품질에서 우위를 점하는 더 작은 모델이 누가 이 분야에서 작업할 수 있는지를 바꿉니다.
실험 2: 어텐션 재사용, 그리고 원치 않았던 결과
셀프-어텐션은 $O(N^2 ullet d_h ullet H)$의 비용을 발생시킵니다. 시공간적(spatio-temporal) 입력의 경우 토큰 개수 N이 매우 크기 때문에, 픽셀 수에 뷰 수에 타임스텝 수를 곱하게 됩니다. 따라서 명백한 효율성 목표는 어텐션 자체입니다.
트랜스포머 내부를 깊게 갈수록 어텐션 맵이 안정화된다는 관찰을 바탕으로 **어텐션 재사용(attention reuse)**에 대한 깔끔한 연구 흐름이 있습니다. 만약 레이어 9의 어텐션 패턴이 레이어 8과 매우 유사하다면, 왜 아예 쿼리-키 상호작용을 다시 계산해야 할까요? 대신 이전 맵을 재사용하고 변환하세요. 전역 토큰 상호작용은 유지하면서 연산량의 일부를 줄일 수 있습니다.
저희는 STORM-B/8 백본에 Less-Attention 레이어를 통합하고, 나이브(naive) 구현과 최적화된 구현 모두에서 다양한 재사용 비율에 걸쳐 런타임, 메모리, 파라미터 증가량 및 재구성 품질을 측정했습니다.
어텐션 재사용은 최적화된 전체 어텐션 대비 실시간 작동 시간(wall-clock time)을 개선하지 못했습니다. 어떤 재사용 비율에서도 마찬가지였습니다. 심지어 신중하게 구현했음에도 불구하고 말입니다.
그 이유는 이론이 틀렸기 때문이 아닙니다. FLOPs는 실제로 줄어듭니다. 그 이유는 현대 GPU에서 융합된(fused) 어텐션 커널이 이미 병목 현상을 다른 곳으로 옮겼기 때문입니다. 전체 어텐션이 단일 융합 커널로 실행되어 HBM에 어텐션 행렬을 절대 실체화하지 않을 때, 비용을 지불했던 것은 주로 산술 연산(arithmetic)이 아니라 메모리 트래픽이었고 — 따라서
이것이 전체 교훈입니다: FLOP(Floating Point Operations) 수치에서 도출된 알고리즘 최적화는 하드웨어에 대한 가설이지, 하드웨어에 대한 사실이 아닙니다. 하드웨어는 변화했습니다. FlashAttention 스타일의 커널(kernel)은 어떤 연산이 비용이 많이 드는지를 바꾸어 놓았고, "효율적인 어텐션 (efficient attention)" 문헌의 상당 부분은 더 이상 존재하지 않는 기계를 기준으로 암묵적인 비용을 산정했습니다.
차라리 이것이 제대로 작동했더라면 좋았을 것입니다. 무효한 결과(null result)를 발표하는 것은 속도 향상을 발표하는 것보다 재미가 없습니다. 하지만 다른 사람들이 동일한 것을 재구현하는 수고를 덜어주는 무효한 결과는, 벤치마크에서 얻는 또 다른 3%의 성능 향상보다 더 가치 있습니다.
두 사례에서 얻은 점
전체 용량보다 용량 할당 (Capacity allocation)이 더 중요합니다. 파라미터(parameter)를 어디에 배치하느냐는 실제 결과로 이어지는 실질적인 설계 결정이며, "더 크게 만들어라"라는 답변은 어떤 축이 실제로 제약(binding)을 주고 있는지 측정하지 않았을 때 내놓는 답변일 뿐입니다.
대상 하드웨어에서 실제 실행 시간 (wall-clock)을 측정하세요. 항상 그래야 합니다. FLOPs도, 파라미터 수(parameter counts)도, 점근적 복잡도(asymptotic complexity)도 아닙니다. 그것들은 대리 지표(proxies)이며, 대리 지표는 하드웨어가 진화함에 따라 어긋납니다. 모든 효율성 주장은 그 뒤에 "내가 테스트한 기계에서는"이라는 무언의 전제를 달고 있습니다.
어떤 지표를 놓쳤는지 보고하세요. 우리의 깊이 RMSE(Root Mean Square Error)는 악화되었습니다. 이 연구를 바탕으로 무언가를 구축하는 사람은 PSNR의 소수점 한 자리를 더 아는 것보다 이 사실을 아는 것이 훨씬 더 필요합니다.
직관은 하중을 지탱하고 있지만 대부분 검증되지 않았습니다. "더 깊을수록 좋다"와 "FLOPs가 적을수록 빠르다"는 모두 합리적인 사전 지식(priors)이었으나, 우리의 설정에서는 운 나쁘게도 틀린 것으로 판명되었습니다. 저는 가정을 하는 대신 어블레이션 연구 (ablation study)를 실행함으로써 그 사실을 알게 되었습니다.
만약 당신이 뉴럴 렌더링 (neural rendering), 월드 모델 (world models), 또는 트랜스포머 효율성 (transformer efficiency) 분야에서 작업하고 있다면, 깊이보다 너비가 더 낫다는 결과가 당신의 환경에서도 유지되는지 진심으로 듣고 싶습니다. 저의 사전 지식은 이것이 밀집 예측 (dense prediction) 작업에는 일반화되지만 그 이상으로는 잘 적용되지 않을 것이라는 것이지만, 그것은 어디까지나 사전 지식일 뿐이며 이 포스트는 주로 그러한 지식들이 어떻게 작용하는지에 관한 것입니다.
논문: "Rethinking Transformer Design for Dynamic Scene Reconstruction: An Efficient, Width-Dominant Approach" (IJCNN 2026) 및 "Evaluating Attention Reuse in Dynamic 3D Gaussian Reconstruction" (ICPR 2026).
저는 월드 모델 (World Models), 로보틱스 데이터 파이프라인 (Robotics Data Pipelines), 그리고 측정이 조용히 실패하는 방식에 대해 글을 씁니다. linkedin.com/in/rickeshnatarajan
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기