ARC-AGI-1에서 44% 달성, 67센트의 비용으로
요약
작성자는 5090 GPU로 작은 트랜스포머 모델을 단시간에 학습시켜, 높은 성능과 낮은 비용을 동시에 달성했음을 발표했습니다. 이 연구는 샘플 효율성을 핵심 목표로 삼아 ARC(Abstraction and Reasoning Corpus) 벤치마크에서 뛰어난 결과를 보여주었으며, 오픈 소스로 공개되었습니다.
핵심 포인트
- 샘플 효율성이 AI의 가장 중요한 문제이며, 이를 해결하는 데 집중함.
- ARC-AGI에 대한 연구를 진행하며, 트랜스포머 기반 모델을 사용함.
- 모델 성능 향상은 아키텍처 개선과 데이터 셔플링 최적화 덕분임.
- 연구 결과와 코드를 GitHub에 공개하여 커뮤니티의 주목을 받고 있음.
저는 5090 GPU로 1.5시간 만에 작은 트랜스포머 모델을 처음부터 학습시켰습니다.
많은 LLM보다 성능이 뛰어나며, TRM/HRM과 동일한 점수를 기록합니다.
이는 제가 이전에 개발했던 모델의 업그레이드 버전입니다.
더 빠르고, 더 좋고, 더 저렴하며, 여전히 오픈 소스입니다.
또한 ARC-2에서도 7%를 달성했습니다.
트위터에서 논의하고, 코드는 github에 공개했습니다.

이것은 ARC-AGI에 대한 일련의 작업 중 세 번째 블로그입니다. 이전 글로는 Blog 2와 Blog 1이 있습니다.
많은 사람들이 이전 결과를 불가능하다고 생각했지만, 이 결과는 최고 연구자들로부터 주목을 받았고 X에서 입소문을 탔습니다. 예를 들어 Lucas Beyer, Jeremy Howard, Rohan Anil의 논의와 다른 많은 사람들의 댓글들이 있었습니다.
왜 이 작업에 집중하는가?
저는 샘플 효율성(sample efficiency)이 오늘날 AI에서 가장 중요한 문제라고 생각하며, 이를 해결하고 싶습니다.
이 연구의 의도는 (1) 트랜스포머/오늘날 딥러닝 방법론으로 제한했을 때 샘플 효율성의 한계를 찾고 (2) 비용을 줄여 반복 작업(iteration)을 훨씬 빠르고 저렴하게 만드는 것입니다.
ARC는 이를 테스트하기에 아주 좋은 벤치마크입니다:
- 고차원 공간에서 매우 적은 수의 샘플(단지 1000개의 퍼즐)
- 메타러닝(metalearning) 벤치마크이므로, 각 퍼즐은 공통 개념을 가지지만 다른 규칙을 사용합니다.
- 필요한 사전 지식(priors)이 매우 적게 필요합니다: 평가 세트에서 필요한 모든 개념은 학습 세트에 존재합니다.
- 인간에게는 풀기가 믿기 쉬우며, 심지어 역량이 부족한 AI 연구자도 접근할 수 있습니다.
- 이 벤치마크는 아직 포화되지 않았습니다 (데이터 효율성 측면에서는 LLM과 엄청난 양의 합성 데이터 또는 인간의 귀납적 편향을 사용하는 접근 방식을 무시합니다).
다음으로, 저는 이러한 한계를 돌파하기 위한 새로운 연구 아이디어를 작업할 것입니다. 전 세계 누구라도 이 작업을 할 수 있도록 비용을 낮게 유지하려고 노력할 것입니다.
기술 상세 정보
작동 원리
전반적인 접근 방식은 지난번과 유사합니다 (자세한 기술적 내용은 여기에 있습니다). 하지만 제가 여러 업그레이드를 추가했습니다. 접근 방식에 대한 간략한 요약은 다음과 같습니다:
- 각 입출력 쌍은 토큰 시퀀스로 변환됩니다. 이 시퀀스들은 작은 트랜스포머를 통해 자기회귀적으로 학습됩니다. 이는 테스트 시간(test time)에 트레인 세트와 에밸 세트의 퍼즐 모두에서 처음부터 수행됩니다(테스트 레이블 숨김).
- 태스크 간 학습(cross-task learning)을 가능하게 하기 위해, 각 퍼즐에는 별도의 가산 임베딩(additive embedding)이 부여됩니다(학습됨). 각 시퀀스는 두 개의 2D 그리드를 가지므로, 위치 정보는 3D RoPE 임베딩을 사용하여 학습됩니다.
- 이 시퀀스들은 색상 및 이면각 순열(dihedral permutations)로 증강됩니다. 추론(inference)하는 동안 테스트 입력이 증강되고, 출력된 결과에는 역증강(inverse aug)이 적용됩니다. 가장 흔한 상위 2개의 출력이 제출됩니다 (AAIVR).
지난번 대비 변경 사항
주요 목표는 모델의 샘플 효율성(sample efficiency)을 향상시키는 아키텍처/알고리즘 개선점을 찾는 것이었습니다.
점수 증가의 가장 큰 원인은 다음과 같습니다:
- 현대적인 아키텍처 (GELU 대신 SwiGlu, 레이어노름 대신 RMSnorm 등)
- 더 다양한 데이터, 데이터 셔플링 개선
- 스케일업: 4개 레이어 대신 8개 레이어,
비용 감소의 가장 큰 원인은 다음과 같습니다:
- 훨씬 적은 증강 (더 높은 샘플 효율성!)
- AdamW $ o$ Normuon
- varlen 학습을 사용한 flash attention + 추론을 위한 flex attention 커널
주요 변경 사항은 더 이상 입력 토큰으로 학습하지 않는다는 것입니다. 이는 손실 함수가 출력 토큰만 포함하도록 만든다는 의미이며(접근 방식을 지도 학습(supervised)으로 만듦), 이로 인해 약간 더 나은 성능(40% $ o$ 44%)을 보이지만 그 이유를 이해할 수 없습니다. 아마도 유한 모델 용량 때문일 것입니다.
또한 ARC-2의 비중복 태스크들을 추가하여 학습 데이터를 늘렸습니다. 누수(leakage)가 발생하지 않도록 매우 신중하게 진행했습니다. 원치 않는다면 이 추가 데이터는 제거해도 약 40% 점수를 유지할 수 있지만, 컴퓨팅 자원은 약 두 배로 필요합니다.
배경: ARC-2에는 773개의 ARC-1 퍼즐과 347개의 새로운 퍼즐이 포함되어 있습니다. ARC-1의 대부분의 에밸 퍼즐은 반복되므로, 만약 ARC-2로 순진하게 학습한다면 데이터 누수(dataleak)가 발생하여 100% 점수를 얻게 됩니다. 저는 이 문제를 방지하기 위해 773개의 반복되는 퍼즐을 신중하게 필터링했습니다(따라서 누수 없음!)}
성능이나 속도 면에서 점진적인 개선을 가져온 다른 많은 변경 사항들이 있습니다. 전체 변경 목록은 여기에서 확인하세요.
흥미로운 동작 (Interesting behaviour)
제가 더 이상 입력(inputs)으로 학습하지 않기 때문에, 이 접근 방식은 이제 지도 학습(supervised)입니다. 이상한 점은 테스트 손실(test loss)이 오히려 나빠졌음에도 불구하고 점수가 더 높다는 것입니다! 또한 더 안정적이고 점수의 분산(variance)도 적습니다.
요즘 많은 사람들이 작은 데이터셋에서 가장 낮은 검증 손실(val loss)을 목표로 샘플 효율성(sample efficiency)에 힘쓰고 있습니다. 저는 이것이 훌륭하다고 생각하지만, 이는 그러한 접근 방식의 실패 모드(failure mode)를 보여줍니다.
저는 비지도 학습 스타일의 훈련(unsupervised style training)이 일부 시나리오에서는 더 좋을 것이라고 생각하며, 현재 이를 평가하고 있습니다.
NorMuon을 사용하기 전에는 바닐라 Muon을 사용해 보았습니다. 당연히 AdamW보다 훨씬 빠르게 훈련되었지만, 손실값(loss)과 점수(scores)가 수렴하는 대신 마지막에 머무르는 경향이 있었습니다. 이 지점에서 모멘텀(momentum)이나 학습률(LR)을 급격하게 낮추는 것이 도움이 된다는 것을 알았지만, 이렇게 수동으로 변경하고 싶지는 않았습니다. NorMuon으로 전환했을 때 그 문제가 사라졌습니다.
제거 실험 (Ablations)
성능에 가장 큰 기여를 한 부분은 좋은 표현(good representations)입니다 (3D RoPE + per-task embedding).

- 입력으로 훈련하는 경우 성능이 약간 떨어짐 -> 약 39%
- 훈련 세트를 ARC-1+ConceptARC로 제한하는 경우도 비슷함: ~40%
- 3D RoPE에서 1D로 전환하면 점수가 ~24%까지 하락함
- per-task embedding을 제거하면 점수가 ~24%까지 하락함
- 모델을 CompressARC 스타일로 실행하는 경우 (각 태스크별로 처음부터 독립적으로 훈련하고, 비지도 학습), 성능이 ~18%까지 떨어짐
- CompressARC를 지도 학습으로 하는 경우 약 15%에 도달함

다른 사람들은 어떻게 기여할 수 있나요?
코드는 오픈 소스입니다. 자유롭게 수정하여 점수를 개선하거나 비용을 절감해 주세요. (훈련 데이터는 늘리지 말아주세요)
65%에 도달하는 것을 목표로 해보세요 – 많은 수정이 필요하지 않을 것입니다. 증거: 저는 여러 번의 실행에서 해결된 모든 태스크를 합쳐서 55%를 얻었습니다. 또한 다른 많은 태스크들이 '거의' 해결되었습니다. 몇 가지 아이디어:
- RoPE는 위치 정보와 내용 정보를 혼합하는데, 이는 아마도 성능을 저하시킬 것입니다. PoPE가 동등하거나 더 나은 성능을 보여야 합니다. 아니면 새로운 위치 임베딩(pos embedding)을 발명해야 할지도 모릅니다.
- 아키텍처를 확실히 더 현대화할 수 있습니다.
비용은 수작업 GPU 코드를 사용하면 10배 정도 줄일 수 있을 것입니다. 또한 이것을 가능하게 하는 아키텍처 변경 사항도 있습니다.
마지막으로, 데이터 증강(data augmentations)을 어떻게 제거할지 알아내야 합니다. (이걸 사용한 게 정말 싫어요. 괜찮다고 생각하는 사람은 무시하세요). 그렇게 할 몇 가지 명백한 방법이 있지만, 도전 과제는 훈련 비용을 낮게 유지하는 것입니다.
기타
솔직히 말해서, 트랜스포머만으로 45%에 도달할 줄은 예상하지 못했습니다. 새로운 아이디어가 필요할 거라고 생각했거든요. 이렇게 낮은 비용/플롭스로 달성할 것이라고는 정말 기대하지 않았습니다. 제거(ablations) 실험 결과는 증강이나 합성 데이터가 없어도 놀라울 정도로 많은 성능이 유지된다는 것을 보여줍니다. 이제 저는 65%에 트랜스포머 프레임워크 내에서 도달할 수 있다고 확신합니다.
다른 사람들은 왜 이걸 알아내지 못했는지 이해가 안 됩니다. 가장 명백한 표현을 가진 트랜스포머일 뿐입니다. 이 벤치마크는 공개된 지 6년이 되었고, 높은 관심을 받았으며, 백만 달러의 상금이 걸렸습니다! 어쩌면 연구자들이 딥러닝(deep learning)을 과소평가하는 것일까요? 아니면 실험 비용이 충분히 높아서 제거 실험을 제대로 할 수 없었던 건 아닐까요? LLM에 의해 속거나 하니카스(harnesses)를 사용했기 때문일까요?
부록
유명 연구자들로부터 제 접근 방식에 대한 이전 비판/검증
제 예전 결과는 X에서 입소문을 탔고, 많은 경험 있는 연구자들이 찬반양론으로 토론했습니다. Jeremy, Lucas, Susan, Andreas, Yoav 등 여러 사람들의 스레드가 있었습니다. 저는 여기에 모든 비판과 저의 답변을 나열합니다.
평가 퍼즐(eval puzzles)로 훈련하는 것은 부정행위 / “테스트에서 학습”
평가 퍼즐(eval puzzles)로 훈련하는 것은 부정행위 / “테스트에서 학습”
- 아니요, 이것은 거짓입니다. ‘테스트에서 학습’이란 테스트 데이터의 레이블을 가지고 훈련한다는 것을 구체적으로 의미합니다. 이 레이블들로 훈련된 것이 아닙니다. - 또한, ARC는 메타학습(metalearning) 벤치마크이므로, 평가 퍼즐(eval puzzles)로부터 학습해야 합니다.- 전문 용어: ARC에는 학습용 퍼즐(train puzzles) 세트와 평가용 퍼즐(eval puzzles) 세트가 있습니다. 각 퍼즐은 예시 쌍(example pairs)과 테스트 쌍(test pairs)으로 구성됩니다. 한 쌍은 입력 그리드 + 출력 그리드로 이루어집니다.
- ARC에서 레이블은 오직 평가 퍼즐의 테스트 쌍의 출력 그리드일 뿐입니다. - 이 레이블들은 훈련에 사용되지 않았습니다. 숨겨져 있습니다. 원하시면 미리 삭제할 수 있습니다.
평가 퍼즐의 입력으로 훈련하는 것은 정보 유출을 일으킨다
- 아니요, 이것은 거짓입니다. 이러한 접근 방식은 전이적 추론(transductive reasoning)이라고 불리며 Vapnik 시대부터 연구되어 왔습니다. - 또한, 평가 입력을 무시해야 한다는 이 교리는 지속 학습(continual learning)을 해결하려는 세상에서는 말이 되지 않습니다.
- 다른 접근 방식들은 메타학습 알고리즘을 훈련한 다음, CoT(Chain of Thought)를 실행하거나 순환 구조(recurrent loop)를 통해 잠재 변수(latents)를 수정함으로써 배포하여 학습합니다. 제가 사용한 방법 또는 여기서 한 것은 단일 포워드 함수(forward function)의 가중치를 수정함으로써 직접 메타학습하는 것이 학습을 통해 얻는 것과 다를 바가 없습니다.
- 참고: 새로운 44% 결과에서는 입력으로 훈련하는 것을 제거했기 때문에 점수가 약간 더 낮게 나왔습니다.
평가 퍼즐의 입력으로 훈련하는 것이 허용된다 하더라도, 테스트 입력은 특히 금지되어야 한다
-
아니요, 이것은 거짓입니다. 동일한 ‘전이(transduction)’ 논리가 여기에 적용됩니다. - 메타학습 벤치마크는 두 가지 방식으로 전이적일 수 있습니다:
-
학습 퍼즐 $ o$ 평가 퍼즐
-
평가 퍼즐 내에서, 예시 쌍 $ o$ 테스트 쌍
-
이 비판은 후자(latter)에 의해 구체적으로 답변됩니다.
이것은 테스트 정책 위반이다
-
아니요, 이것은 거짓입니다. - 정책에는 “응시자는 시험이 무엇일지 알면 안 된다”고 명시되어 있습니다. 사람들은 이를 TTT(Test Taking Test)가 금지된다는 의미로 해석했습니다. 하지만 실제로는 AI 시스템 자체를 말하는 것이 아니라, AI 시스템을 설계하는 인간을 지칭합니다.
-
예: 평가 세트를 기반으로 귀납적 편향(inductive biases)을 설계하는 것을 억제하기 위함.
-
ARC 커뮤니티에서 활동하는 모든 사람에게 이 점은 테스트 시간 학습(test time training)이 허용되고 장려되어 왔기 때문에 항상 명확했습니다. Steven과 Chew의 코멘트가 이를 그리고 다른 우려 사항들을 명확히 합니다.
-
TTT 역시 메타학습 벤치마크(metalearning benchmark)의 정신을 따르므로 괜찮습니다!
학습 비용은 포함하지 않았습니다
- 아닙니다, 이것은 거짓입니다. 저는 전체 수명 주기 컴퓨팅량(lifetime compute)을 보여줍니다. 이것은 모델을 초기화 시점부터 학습시키는 비용과 모든 태스크에 대한 추론 실행 총 비용입니다. 네, 이는 완전히 67센트에 달합니다. vast.ai에서 5090의 2시간 가격을 확인해 보세요.
테스트 시간 학습은 전통적으로 한 번에 하나의 태스크를 수행합니다. 모든 테스트 태스크에 대해 한꺼번에 학습하는 것은 비현실적입니다
- 네, 이 비판은 일리가 있습니다. 하지만 미묘한 차이가 있습니다.
- 실제 생활에서 모든 문제가 한 번에 주어지는 '직면 문제 세트(face problem sets)'를 보는 경우는 드물다는 점에는 동의합니다. 설령 그렇다 하더라도 (시험과 같은 경우), 인간은 보통 한 번에 하나만 시도할 수 있습니다.
- 하지만 인간이 어떤 능력을 갖지 못한다고 해서 그 능력을 가진 AI 모델을 구축하는 것이 무효하다는 의미는 아닙니다. 그렇지 않다면, 인간이 전체 인터넷에서 학습하거나 / 토큰을 빠르게 읽을 수 없다는 이유로 LLM(대규모 언어 모델)도 비현실적이라고 말할 수 있을 것입니다.
- 또한, 인간이 하나에 국한된다고 명확하지 않습니다. 여러 감각으로부터 동시에 다른 데이터를 학습할 수도 있습니다. 정확히 다음과 같이
모든 테스트 태스크가 한 번에 학습되기 때문에 태스크당 비용을 제공하는 것은 학습 비용을 상쇄합니다. 따라서 다른 모델과 비교하는 것은 불공평합니다
-
네, 이것은 공정합니다. 제 변명하자면:
-
조직위원회는 TRM(Test-Time Retraining Model)을 포함하여 모든 테스트 태스크에 대해 한 번에 학습시키는 모든 모델을 그렇게 비교합니다.
-
저는 또한 LLM 및 다른 모델들이 사전 학습/오프라인 학습 비용을 제외하는 것과 달리, 학습 및 추론 비용을 모두 포함함으로써 더 관대했습니다.
-
이제 (a) 태스크당이 아닌 수명 주기 컴퓨팅 비용을 보여주는 것으로 변경했고, (b) TRM, HRM, CompressARC와만 비교하고 LLM / 다른 방법과는 비교하지 않으며, (c) 비교 가능한 학습 스타일로 어블레이션(ablations)을 추가했습니다.
ARC-AGI 자체에 대한 비판 답변
이전에 게시했을 때, ARC-AGI 자체에 대해 많은 논쟁이 있었습니다. 일부는 타당했지만, 상당수는 Chollet이 이전에 여러 번 답변한 질문들이었습니다:
- ARC가 실제로 무엇을 테스트하는가? (유동 지능)
- 왜 우리가 ARC에 신경 써야 하는가? (유동 지능은 완전히 해결되지 않았다)
- ARC-AGI를 해결한다고 해서 AGI로 이어지지 않을 것이다 (아무도 그렇게 주장하지 않았다)
- ARC는 목표 설정을 계속 바꾼다 / LLM을 위해 적대적으로 구성되었다 (둘 다 거짓이다)
Chollet의 논문과 이 트윗들1이 좋은 자료입니다. 그의 입장을 요약하자면 다음과 같습니다: 이 벤치마크는 유동 지능을 테스트하기 위한 것이며, 그는 이를 AGI에 필요하지만 충분하지 않은 것으로 간주합니다. ARC-1 / 2를 해결하는 것은 0이 아닌 유동 지능을 의미하지만, 그것은 상한선(upper bound)은 아닙니다. 이 벤치마크들은 AGI가 달성되었음을 알리는 것이 아니라, 던져야 할 올바른 연구 질문들을 가리키는 것을 목표로 합니다. 목표 설정이 바뀐 적은 없습니다: ARC-1은 LLM보다 앞섰고, ARC-2는 ChatGPT 이전에 발표되었으며, ARC-3은 ARC-2가 포화되기 전에 발표되었습니다. 그는 또한 ARC의 진행 상황에 대해 만족하는데, 이는 AI의 발전을 기록하기 때문입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Lobste.rs AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기