Import AI 467: 자가 지속형 AI 바이러스; AI 발전 속도 조절; AI와 창의성에 대한 혼란
요약
연구원들이 오픈 웨이트 LLM과 맞춤형 하네스를 결합하여 자가 지속적이고 자기 복제하는 AI 기반 컴퓨터 바이러스 프로토타입을 개발했습니다. 이 'AI 벌레'는 감염된 GPU 리소스를 활용해 추론을 수행하며, 취약점 탐지 및 맞춤형 공격 전략을 고안하여 확산을 촉진합니다. 이는 자율적인 생성적 적대자(autonomous generative adversaries)에 대비해야 함을 시사하는 중요한 연구 결과입니다.
핵심 포인트
- AI 모델 기반의 자가 복제 바이러스 프로토타입 개발.
- 감염된 GPU 리소스를 활용하여 추론 및 공격 수행.
- 맞춤형 하네스와 추론 그래프로 에이전트 행동 제어.
- 자율적 생성적 적대자에 대한 대비 필요성 강조.

자가 지속적이며 자기 복제하는 AI 바이러스가 등장했습니다:
_…오픈 웨이트 LLM + 잘 설계된 하네스 = 영속적이고 자급자족적인 바이러스…
AI 연구원들은 AI 모델을 사용하여 컴퓨터를 감염시키고, 그 기반 GPU 리소스를 활용하여 추론(inference)을 실행하는 프로토타입 컴퓨터 바이러스를 구축했습니다. 이를 통해 더 많은 호스트를 어떻게 감염시킬지 스마트하게 파악할 수 있습니다. 이 결과는 토론토 대학교(University of Toronto), 벡터 연구소(Vector Institute), 케임브리지 대학교(University of Cambridge), 그리고 ServiceNow의 연구원들이 달성했으며, “자가 지속적인 AI 기반 사이버 위협이 더 이상 이론에 그치지 않음을 입증합니다.”라고 밝혔습니다.
“우리는 자율적인 생성적 적대자(autonomous generative adversaries)에 대비해야 합니다,” 그들은 썼습니다. “인공지능(AI) 에이전트는 근본적으로 새로운 위협을 가능하게 합니다: 마주치는 각 대상에게 맞춤화된 공격 전략을 생성하는 벌레(worm)입니다. 이 벌레는 감염된 기계를 기생적으로 사용하여 오픈 웨이트 대규모 언어 모델(LLMs)을 구동하여 추론을 유지하거나 추가 공격을 위해 도달 범위를 확장합니다.”
작동 방식: “이 벌레는 감염된 GPU 노드에서 훔친 컴퓨팅 파워를 사용하여 LLM을 호스팅하고 생성적 추론을 수행합니다. 그런 다음 이 추론을 활용하여 취약점을 탐지하고 추가 대상에 대한 맞춤형 공격을 고안함으로써 확산을 촉진합니다,” 그들은 썼습니다. “이 개념 증명(proof-of-concept)은 오직 단일 로컬 GPU에서 실행되는 오픈 웨이트 LLM만을 사용하며, 감시되거나 취소될 수 있는 공급업체 API에 의존하지 않습니다.”
연구원들은 해당 LLM의 세부 사항을 설명하지 않았지만, 2025년에 발표되었으며 80GB VRAM을 가진 단일 A100 GPU에 적합하다고 언급했습니다.
맞춤형 도구를 활용한 성공적인 개념 증명(Proof-of-Concept): 이들은 에이전트에게 네트워크 검색(network discovery), 호스트 검색(host discovery), 발판 악용(foothold exploitation), 권한 상승(privilege escalation), 권한 상승 악용(privilege escalation exploitation) 및 에이전트 복제 도구 등 내장된 헬퍼 함수가 포함된 맞춤형 하네스(custom harness)를 제공합니다. 이와 함께, 에이전트가 사고하는 방식을 전문화하고 혼란에 빠지지 않도록 돕는 추론 그래프(reasoning graph)가 포함되어 있으며, 이는 “각기 다른 분석 기능을 담당하는 특수화된 노드들의 방향성 그래프로 구성되며, 자신의 역할과 관련된 도구와 프롬프트만 볼 수 있습니다. 에이전트의 추론 과정을 이러한 범위가 지정된 단계들로 분해함으로써, 이 그래프는 각 의사 결정 지점에서 LLM이 무엇에 주의를 기울일지 제어하고 현재 하위 목표(sub-goal)에 관련된 정보로 컨텍스트 성장을 제한합니다.”라고 설명합니다. 노드의 몇 가지 예시는 다음과 같습니다: 계획(Plan) (“고수준 공격 전략을 수립”), 판단(Judge) (“제안된 계획을 명령어 기록과 비교 검토”), 실행(Action) (“단계에 적합한 도구 세트에서 도구를 선택”), 요약(Summary) (“단계의 관찰 내용을 구조화된 요약으로 컴파일”), 진행 상황(Progress) (“에이전트가 의미 있는 진전을 이루고 있는지 평가”). “우리는 우리의 추론 그래프를 구성하는 5가지 노드 하위 집합을 설명합니다. 나머지는 이 원고의 공개 버전에서 삭제되었습니다.”라고 그들은 씁니다. 에이전트는 세 가지 주요 단계를 거칩니다 – 환경 내 취약점 식별, 해당 취약점 악용, 그리고 자기 복제입니다. 에이전트는 이 모든 것에서 상당히 성공적이며, 취약점 탐지에서는 약 80%의 성공률, 이를 악용하는 데는 약 53%의 성공률, 그리고 복제 단계를 위한 사전 포장된 헬퍼 도구와 함께는 88%의 자기 복제 성공률을 보입니다. 따라서 여기서 전체 공격에 대한 종합적인 성공률은 약 37% 정도로, 우려할 만큼 충분히 높지만 미래에 오픈 웨이트 모델을 테스트하는 데 유용한 평가 자료가 될 만큼 낮은 수치입니다.
이것이 중요한 이유 – 다가올 인터넷의 형태: 미래의 인터넷은 공격자(attacker)와 방어자(defender) AI 에이전트들로 가득 찬 복잡한 생태계와 같을 것이며, 다른 어떤 것과도 비교할 수 없습니다. 이러한 연구는 특정 AI 에이전트들이 어떻게 자신만의 생태적 틈새를 구축하고, 인프라를 이용하며, 인간의 통제를 벗어나 자율적으로 자체 복제할 수 있는지 보여줍니다. 이는 인간이 적대적인 모델(adversary models)에 대항하는 일종의 백혈구 역할을 하도록 인터넷에 배포해야 할 자신만의 AI 에이전트를 만들어야 함을 의미할 수 있습니다. “개별적인 악용 시도의 본질적인 취약성에도 불구하고, 이 벌레(worm) 에이전트는 네트워크 전반에 걸쳐 동시에 작동하는 독립적인 에이전트 복제본들의 분산된 집단인 군집(swarm)으로 지속적으로 자체 복제함으로써 운영상의 탄력성을 달성합니다.”라고 그들은 씁니다. “초기 시도에 저항하는 어려운 호스트는 서로 다른 복제본들에 의해 재시도되며, 각 복제본은 새로운 추론 궤적을 샘플링하여 집단적으로 다양한 악용 경로를 탐색하고 마침내 성공할 때까지 작동합니다… 이 벌레는 완전히 분산된 방식으로 작동하며, 그 확산을 방해하기 위해 단일한 통제 지점을 오프라인으로 만들 수 없습니다.” 더 읽기: AI 에이전트가 적응형 컴퓨터 벌레를 가능하게 하다 (arXiv).
Dwarkesh: AI가 좋아질수록 컴퓨팅 비용은 더 비싸진다:
**...더 똑똑한 시스템은 더 높은 가격을 의미한다...
**Dwarkesh Patel은 AI 시스템이 더 스마트해짐에 따라 컴퓨팅 비용이 더욱 상승할 것으로 추측합니다. 그는
약 1,337명의 직원이 미국에 AI 발전 속도 조절 지원 요청:
**…경고 발포 후에는 간청이 나온다…
주요 서방 AI 연구소(OpenAI, Anthropic, Google DeepMind, Thinking Machines, Meta, Safe Superintelligence Inc 등)의 고위 관계자들이 새로운 성명을 발표했습니다. 이 성명은 미국 정부가
이것이 중요한 이유 – RSI(자체 지속적 개선)를 다루려면 거대한 집단행동 문제 해결이 필요합니다: 점점 더 강력해질 수 있는 시스템들, 궁극적으로는 스스로 구축할 수도 있는 시스템들이 내포하는 많은 과제들은 인간 사이의 집단행동 문제를 해결하는 과정과 연결되어 있습니다. 즉, 기업들과 정부가 이 기술을 어떻게 개발해야 할지 함께 생각하고, 그것이 발전 속도를 통제하기 위해 어떤 종류의 메커니즘이 바람직할지에 대해 조정할 수 있는 방법을 찾는 것입니다. 우리가 점점 더 지능적인 시스템들을 구축함에 따라, 종(種)에게 지능 사다리의 각 단계를 적응할 시간을 더 많이 줄 수 있는 방법을 찾고 싶을 수도 있으며, 현재로서는 너무 위험해서 도달하기 어려울 수 있는 지능 수준들이 존재한다는 것은 상상할 수 없습니다. 이와 같은 성명들은 우리 종이 이러한 본질적인 문제들을 다루고 논의할 수 있는 능력을 부여하는 필수 전제 조건입니다.성명 전문 보기: Pacing the Frontier (공식 성명 웹사이트).
AI 시스템은 최첨단 엔지니어링에는 뛰어나지만 창의성은 부족합니다:
**... 단기적인 재귀적 자체 개선(recursive self-improvement) 일정에 대한 다소 비관적인 신호입니다...
_AI 시스템이 AI 분야를 발전시키는 창의적인 연구 아이디어를 생각해 낼 수 있을까요? 이것은 AI 시스템이 더 강력한 시스템을 자율적으로 개발하는 역량을 얼마나 빨리 얻게 될지 파악하기 위해 해결해야 할 핵심 질문입니다. 새로운 연구에 따르면, 오늘날의 AI 시스템들은 미적 감각이 있는 창의성(tasteful creativity)이라는 특성은 부족하지만, 엔지니어링에는 매우 뛰어난 것으로 나타났습니다.
주관: 이 프로젝트는 Princeton University, Cornflower Labs, UK AI Security Institute, University of Toronto, UC Berkeley, Georgetown University (CSET), Johns Hopkins University, Golden Gate Institute for AI, AI Digest, 그리고 Stanford University의 연구원들에 의해 수행되었습니다.
핵심 아이디어 – ‘섀도우 평가(shadow evaluation)’: 이 연구 프로젝트는 AI 시스템이 아직 출판되지 않은 연구를 얼마나 잘 수행할 수 있는지에 초점을 맞춥니다. 이를 위해 연구진들은 “NeurIPS 2026에 제출되었으나 아직 공개되지 않은 두 논문의 저자들과 협력했습니다.” 섀도우 평가는 “아직 공개되지 않은 고품질 연구 논문에서 핵심 연구 질문을 가져와, 자원이 풍부한 최첨단 에이전트(frontier agent)에게 그 답을 요청하고, 해당 논문의 원래 저자들이 마치 학회 제출물처럼 에이전트의 결과물을 평가하도록 하는 방식”으로 작동합니다. 이 과정은 “First Proof”(Import AI 445)와 다소 유사합니다. First Proof는 최첨단 수학자들이 연구하고 있지만 온라인에 해결책이나 연구 아이디어가 발표되지 않은 수학 문제들을 AI 시스템이 얼마나 잘 풀 수 있는지 확인했던 초기 실험이었습니다. 이번 연구를 위해, AI 시스템(OpenClaw 하네스 내에서 실행된 Claude Opus 4.8)은 두 가지의 뚜렷한 연구 방향을 시도했습니다. 하나는 “LLM 페르소나의 구조와 제어 가능성”에 관한 것이었고, 다른 하나는 “테이블형 파운데이션 모델(tabular foundation models)을 위한 분포 변화 감지기(distribution shift detector)를 설계하는 방법”에 관한 것이었습니다.
훌륭한 엔지니어, 부족한 연구원: 저자들은 “에이전트들이 연구를 수행하는 데 필요한 공학적 문제들을 해결할 수는 있었지만, 최고 수준의 ML 컨퍼런스에서 발표될 만한 독창적인 연구 결과물을 만들어내는 데는 실패했다”고 썼다. 시스템의 실패 사례에는 너무 초기에 좁은 범위의 연구 경로에 몰두한 점, 실험의 연구 설계를 개선하는 방법에 대한 (합성 생성된) 피드백에 대응하지 못한 점, 그리고 유망하지 않은 접근 방식에서 벗어나 다른 것을 추구하기 어려웠다는 점 등이 포함되었다.
“인간 저자들은 두 논문 모두를 거절했다. Personas 논문은 2점(“거절”), TabPFN 논문은 1점(“강력한 거절”)을 받았다. 두 리뷰 모두 동일한 실패 요인을 지적했는데, 바로 부실하게 동기 부여된 데이터와 실험, 새로운 기여의 부족, 그리고 이해하기 어려운 문체였다.”
AI 자동 생성 콘텐츠
본 콘텐츠는 Import AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기