Import AI 470: 기계의 권리 없음; SPADE를 이용한 환경 자동 생성; Hawkeye로 더 나은 GPU 커널 구축
요약
본 기사는 METR 분석을 바탕으로 AI가 과학 기술의 여러 분야에 미치는 영향을 분석합니다. 사이버 보안 분야에서는 취약점 보고 비율이 급격히 가속화된 반면, 수학이나 AI 자체 연구 영역에서의 기여는 상대적으로 적거나 측정하기 어렵다는 점을 지적합니다. 이는 AI 발전 효과가 모든 분야에 걸쳐 균일하지 않음을 보여줍니다.
핵심 포인트
- AI의 기술 발전 기여도는 분야별로 불균일하며 '불규칙한 가속화' 양상을 보임.
- 사이버 보안 취약점 보고는 2025년 대비 2026년에 극적으로 가속화됨.
- 수학 및 AI 연구에서의 LLM 기여는 측정하기 어렵거나 상대적으로 낮은 수준임.
- AI 발전은 특정 기술이 '상(phase) 변화'를 겪을 때 가장 큰 가속화를 보일 수 있음.

AI는 일부 유형의 진보는 가속화하지만, 다른 영역에서는 그렇지 않다:
…좋은 METR 연구가 어느 부분에서 가속화가 일어나고 있는지 보여준다…
METR에서 분석한 내용으로, AI가 어떤 과학 및 기술 분야를 가속화하고 있을지 살펴본 분석이 있다. 이 연구는 사이버(cyber), 수학(math), 그리고 AI 연구의 세 가지 다른 영역을 다루며, AI가 사이버에는 많이 기여했고, 수학에는 조금 기여했으며, AI 자체에 대해서는 말하기 어렵다는 것을 발견했다.
LLM은 실제로 과학적 발견에 어떤 차이를 만들었나?
-
사이버 취약점: 큰 가속화. “여러 프로젝트 전반에 걸쳐 보고된 취약점의 비율이 2025년과 비교하여 2026년에 극적으로 가속화되었다. 이는 특정 프로젝트(cURL, OpenSSL, Firefox, Microsoft)와 집계된 취약점 데이터베이스(미국 NVD, OSV) 모두에 해당한다.”
-
수학 연구: 미미한 가속화지만 측정하기 어려움. “AI가 더 많은 작업 수행에 분명히 기여하고 있다 (arXiv 제출 건수가 일부 분야에서 12개월도 안 되는 기간 동안 두 배로 늘었다)는 것을 알 수 있지만, 그러한 기여의 가치를 정량화하는 것은 어렵다.” 스말(Smale) 목록의 자코비안 추측(Jacobian conjecture), 그린(Green) 목록의 문제 44(절반 체(halving sieve)), 그리고 그린의 문제 100의 소피적 절반(sofic half of Green’s Problem 100) 등 권위 있는 목록에 있던 일부 수학 문제가 해결되었다. 하지만 이것이 얼마나 지속적인 추세인지를 판단하기에는 아직 이르다.
-
AI 연구 최적화: 측정 가능한 가속화 없음. 일곱 가지 중요한 문제 영역(CIFAR-10, Hutter 압축, Gurobi 혼합 정수 프로그래밍, MIPLIB, nanoGPT, Stockfish, 행렬 곱셈 지수)에 걸친 알고리즘적 진보를 살펴보면, LLM 기여가 발생한 곳이 몇 군데 있다 (nanoGPT, CIFAR-10). 하지만 이곳에서 AI 사용 증가율은 사이버 보안 및 수학 분야보다 훨씬 낮다.
왜 이것이 중요한가 – 차별적 가속화: 이 논문은 AI가 과학 및 기술의 일부 분야에서 발전을 일으키고 있지만, 그 효과가 모든 분야에 걸쳐 균일하지 않으며, 오히려 불규칙한(lumpy) 가속화 영역(예: 사이버)과 진전이 더 점진적인 영역(수학, AI)이 공존한다고 강조합니다. 저는 가설적으로, 특정 기술에 대해 모델이 일종의 형언할 수 없는 상(phase) 변화를 겪을 때 가속화가 발생한다고 생각하며, 이는 이미 일상적인 코딩(2025년)과 사이버 분야(2026년)에서 명확하게 나타났습니다. 핵심 질문은 우리가 과학 및 기술의 다른 부분에서도 이러한 상 변화를 목격할 것인지, 아니면 그렇지 않을 것인지 하는 것입니다. 더 읽어보기: 연구 노트: 발견에서의 가속화를 보았는가? (METR).
SPADE를 이용한 환경 자동 생성:
_…데이터 폭(data breadth)을 늘리는 것을 통한 RSI 부트스트래핑의 거친 형태…
다수의 대학 연구원 그룹은 SPADE, 즉 Self-Play in Adaptive Synthetic Executable Environments를 개발했습니다. SPADE는 “자체 플레이(self-play)를 통해 환경 합성 및 에이전트 역량(agentic capability)을 공동 진화시키는 일반적인 프레임워크”이며, LLM이 이후 훈련에 사용할 수 있는 게임 같은 형태의 합성 데이터를 생성하는 방식으로 작동합니다. 이를 통해 개발자는 강력한 모델을 사용하여 데이터를 부트스트랩하고, 이 데이터는 다시 동일한 모델을 더욱 개선하는 데 사용될 수 있습니다.
개발 주체: SPADE는 University of Washington, Stanford University, Northeastern University, Carnegie Mellon University, Massachusetts Institute of Technology, National University of Singapore, Seoul National University, Stevens Institute of Technology, 그리고 University of Chicago의 연구원들에 의해 개발되었습니다.
작동 방식: SPADE는 LLM이 실행 가능한 훈련 환경(예: 생물학 실험실에서 시스템이 시뮬레이션된 유전 문제를 해결해야 하는 퍼즐)을 생성하고, 또 다른 LLM이 이를 해결하려고 시도하는 것을 번갈아 수행합니다. SPADE는 사용되는 모델에 대해 두 가지 핵심 역할을 부여합니다:
환경 설계자(Environment Designer)는 실행 가능한 코드로 완전하고 장기적인 호라이즌(long-horizon)의 학습 환경을 작성합니다.
추론 에이전트(Reasoning Agent)는 이러한 환경 내에서 행동하는 방법을 학습합니다. 추론 에이전트에게 주어지는 보상은 특권적 힌트(privileged hint) 유무에 따른 보상 차이를 사용하여 추정됩니다. 특권적 힌트($h$)란 "환경 설계자가 환경에 첨부하는 작업 관련 정보"(예: 부분적인 해답 스케치 또는 핵심 구조 관찰)입니다. 이 $h$를 추론 에이전트에게 공개하면 환경을 해결하기가 더 쉬워지며, $h$ 유무에 따른 추론 에이전트의 리턴(return) 차이가 바로 '환경 설계자의 힌트 기반 후회 보상(hint-based regret reward)'을 정의합니다.
본 기술은 30B 규모에서 작동합니다: 저자들은 SPADE를 테스트하기 위해 세 가지 Qwen3 백본 모델, 즉 Qwen3-4B-Instruct-2507, Qwen3-8B, 그리고 Qwen3-30B-A3B-Instruct-2507을 훈련했습니다. 놀랍지 않게도, Qwen3-30B가 가장 좋은 성능을 보였습니다. 각 모델은 GRPO를 통해 각각 25개 환경에 대한 400회의 롤아웃(rollouts)으로 미세 조정되었으며, AIME, GPQA, LCB 및 Reasoning Gym 내의 환경을 포함한 다양한 벤치마크를 대상으로 평가되었습니다. 이들은 게임 환경과 도구 사용 환경이라는 두 가지 유형의 환경을 생성합니다. SPADE는 두 영역 모두에서 성능을 향상시킵니다. 게임의 경우, "30B-A3B에서 SPADE는 평균 58.3에 도달했으며, 이는 기본 모델 대비 +8.1, 가장 강력한 고정 환경 기반 모델 대비 +5.3를 초과합니다." 도구 사용의 경우에도 동일하게 상당한 향상을 보였습니다: "도구 사용 환경 설계에 적용된 동일한 방법론이 모든 백본 모델을 개선시킵니다."
이것이 중요한 이유 – RSI의 일부: 이것은 기본적으로 정교한 합성 데이터 생성 형태이며, 연구자들이 자신이 가진 어떤 강력한 모델이라도 활용하여 다른 모델이 학습할 수 있는 더욱 다양한 훈련 환경을 생성하도록 하는 것을 의미합니다. 저는 강력한 모델(예: 서로 다른 회사들의 여러 프론티어 모델 간 전환)을 반복적으로 교체함으로써 환경 생성의 다양성을 높일 수 있을 것이라고 생각합니다. 이러한 종류의 기술은 모델 훈련에 사용할 크고 광범위한 데이터셋을 구축하는 비용을 크게 절감시켜 줍니다. 하지만 저자들이 언급했듯이, 이는 환경 생성을 위해 사용된 기본 모델의 상상력 능력 이상으로 모델이 스스로 대규모로 부트스트랩(bootstrap)하도록 허용하지는 않습니다.
그들은 “환경을 Gym 스타일 인터페이스를 가진 Python 프로그램으로 표현함으로써, 이 프레임워크는 단일 턴 추론과 다중 턴 에이전트 작업을 통합하고, 환경 설계를 학습 가능하며 RL로 훈련된 사후 훈련 구성 요소로 전환하여 지속적인 개방형 자가 개선을 가능하게 한다”고 작성했습니다.
더 읽어보기: SPADE: 적응형 합성 실행 가능한 환경에서의 셀프 플레이 (arXiv).
코드 받기, 모델 체크포인트 포함: SPADE (spade-rl, GitHub).
Hawkeye를 이용한 더 나은 GPU 커널 구축:
_…잘 문서화된 단위 테스트는 커널 작성 에이전트의 성능을 향상시킬 수 있습니다…
하버드, 스탠퍼드, Together AI, Caltech 출신의 연구자들이 Hawkeye라는 소프트웨어를 개발했습니다. 이 소프트웨어는 에이전트가 특정 유형의 GPU 하드웨어에 대해 잘 최적화된 커널을 작성하는 방법을 학습하기 쉽게 만듭니다. Hawkeye와 같은 시스템은 본질적으로 AI 시스템이 주어진 하드웨어에서 주어진 AI 시스템의 성능을 최적화하는 것과 같이 AI R&D 관련 작업에서 성능을 높이는 데 사용할 수 있는 도구이기 때문에 중요합니다. 이 프로젝트의 목표는 “최소한의 전문가 개입으로 코딩 에이전트를 어떻게 하드웨어 인식(hardware-aware)하게 만들 수 있을까?”라는 질문에 답하는 것입니다.
Hawkeye는 “최소하고 포괄적인 분류 체계에 자율 커널 생성을 기반을 둔 오픈 소스 프레임워크”라고 연구진은 설명합니다. 이는 “최소한의 감독 하에 코딩 에이전트가 아키텍처별 하드웨어 기능을 활용하고, 신흥 하드웨어 가속기를 지원하는 오버헤드를 줄일 수 있음을 보여줍니다.”
Hawkeye의 핵심 기여는 “코딩 에이전트가 테스트 시간 컴퓨팅을 더 효과적으로 확장하고 하드웨어 인지 커널을 생성할 수 있도록 하는, 일반화 가능하고 최소하며 포괄적인 단위 테스트 분류 체계를 도입하는 것”입니다. 다시 말해, 이는 기본적으로 다양한 하드웨어 플랫폼에 대한 잘 큐레이션된 정보 세트와 해당 플랫폼에서 사용할 최적화 전략들을 단위 테스트 형태로 패키징하여 제공합니다.
연구진은 “각 단위 테스트는 인간이 작성한 솔루션 커널과 최적화를 검증하는 프로파일링 메트릭을 쌍으로 묶는 최소 추상화입니다. 이 솔루션 커널은 에이전트가 구문 예시로 읽거나, 직접 호출하거나, 더 큰 커널에 조각들을 조합할 수 있도록 짧은 사용 가이드와 함께 호출 가능한 함수 형태로 감싸져 제공됩니다.”라고 설명합니다.
결과 – AI 에이전트가 새롭거나 덜 이해되는 하드웨어에 대해서도 좋은 커널을 작성하도록 도움: 그들은 "우리는 Hawkeye를 NVIDIA Ampere, Hopper, Blackwell, 그리고 AMD MI350 전반에 걸쳐, BF16, FP8, NVFP4, MXFP4 정밀도를 아우르는 PyTorch 워크로드를 고성능 커널로 포팅하는 데 평가했습니다"라고 작성했습니다. "torch.compile이 cuBLAS, cuDNN, FlashAttention과 같은 전문가가 튜닝한 공급업체 라이브러리로 디스패치되는 확립된 워크로드의 경우, Hawkeye는 BF16 및 저정밀도 모두에서 이를 일치하거나 능가하며, PyTorch가 네이티브로 실행할 수 없는 형식에서도 마찬가지입니다. torch.compile이 비표준 스캔(scans)과 게이트를 융합할 수 없는 새로운 어텐션 변형의 경우, Hawkeye는 Flash Linear Attention 라이브러리의 전문가가 작성한 Triton 커널 대비 18.9배의 기하 평균 속도 향상을 달성했으며, Hawkeye는 Blackwell에서는 1.22×, MI350에서는 1.00×를 포함하여 모든 아키텍처에서 FLA(Flash Linear Attention)에 근접하거나 능가합니다."
그들은 또한 다소 예상 가능하게 "Hawkeye로 테스트 시간 컴퓨팅을 확장하는 것이 아키텍처 전반에 걸쳐 가장 성능이 좋은 커널을 생성한다"는 것을 발견했습니다.
이것이 중요한 이유 – 약간의 유도만으로, AI 시스템은 최고의 인간을 능가할 수 있습니다: 같은 논문들은 이처럼 단지 인간이 선별한 적은 지식(hand-selected knowledge)만으로도 AI 시스템이 커널과 같이 매우 최적화되고 복잡한 인간 작업의 일부를 일치하거나 초과하는 방법을 배울 수 있음을 보여줍니다. 여기서 얻을 교훈은 우리 종족으로서 Hawkeye와 같은 금 표준(gold-label) 보조 시스템들을 많이 작성할 수 있으며, 그 후 기계가 이를 활용하여 우리의 능력 이상으로 부트스트랩 할 것이라는 점입니다.더 읽기: Hawkeye: 최소 감독 하의 하드웨어 인식 GPU 커널 최적화 (alphaxiv).
***
AI 연구원이 AI 연구 성공의 함의에 겁을 먹다:
_…과학의 성공이 철학적인 난제(can of worms)를 열어젖힐 때 재미가 없다, 하지만 그것이 바로 AI가 의미하는 바이다…
내가 지난 몇 년 동안 다룬 AI 연구원 Julian Togelius는 최근 2025년 AI 연구에 대한 '신념 위기'와 그해 작성한 에세이를 게시했다.
구체적으로 그는 AI 연구의 성공이 인간의 의미에 어떤 영향을 미칠지 걱정했다. 그는 “가끔 새벽 3시에 심장이 두근거리며, 인간의 재능, 지식, 심지어 천재성이 중요하지 않은 미래에 대한 공포로 잠에서 깬다”고 썼다. “우리의 더 큰 기술적 역량이 우리가 더 이상 차이를 만들 수 없는 세상으로 이끌 수도 있고, 우리가 더 많이 이해하는 것이 별 의미가 없을지도 모른다. 어쩌면 우리는 풍요를 얻겠지만, 그 대가로 불필요함(redundance)을 치르게 될 것이다.”
이것이 중요한 이유 – AI는 온 세상을 변화시키는 사회정치적 기술이다: Togelius만이 아니다. 다른 많은 AI 연구원들도 비슷한 문제에 직면해 왔다. 가장 주목할 만한 예로는 튜링상 수상자인 Geoffrey Hinton과 Yoshua Bengio가 있는데, 두 사람 모두 최근 몇 년 동안 경력을 연구에서 돌려 공공 정책 옹호로 전환했다.
나 자신도 이러한 경험을 거쳤고, 작년에 나만의 견해를 담아 “기술적 낙관주의와 적절한 두려움” (Import AI #431)를 작성했다. 내가 그렇지 않을 수 있었겠는가? AI 연구의 성공은 기본적으로 행복한 이야기가 아니다. 오히려 삶의 목적과 기본적인 욕구가 해결된 세상에서 산다는 것이 무엇을 의미하는지에 대해 우리 스스로 거대한 철학적 난제를 열어젖히게 만드는 것이다 (그리고 이것은 우리가 매우 무섭고 사소하지 않은 정렬 문제(alignment issues)를 다룬다고 가정한다).
이 깊이 개인적인 에세이를 쓴 Julian Togelius에게 박수를 보내며, 다른 사람들도 그렇게 하기를 장려한다.
더 읽어보기: Losing my religion (Togelius, 블로그).
AI 자동 생성 콘텐츠
본 콘텐츠는 Import AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기