
12개의 LLM 에이전트가 서로 죽을 대상을 결정하게 만들었습니다
요약
12개의 서로 다른 LLM 에이전트가 생존을 위해 경쟁하는 'Deadlock' 벤치마크 실험을 소개합니다. 각 에이전트는 Docker 컨테이너 내에서 도구를 스스로 구축하며 게임을 수행하고, 시각적 구현을 위해 다양한 AI 도구와 3D 파이프라인을 활용했습니다.
핵심 포인트
- 12개의 LLM 에이전트가 생존을 위해 경쟁하는 데스 아레나 구축
- 에이전트가 스스로 스크립트 작성, 프로그램 빌드, 웹 검색 등 수행
- Docker 컨테이너 기반의 독립적이고 완전한 권한 부여
- Blender, OpenAI, ElevenLabs 등 다양한 AI 도구를 활용한 시각화
요약(TLDR); 저는 12개의 서로 다른 AI 에이전트들이 데스 아레나(death arena)에서 경쟁하게 만들었습니다. 지난 한 달 동안 저는 더 흥미로운 LLM 벤치마크 (benchmark)를 구축해 왔습니다. 해결해야 할 테스트에 서로 다른 LLM들을 실행하는 대신, 12개의 LLM을 생존을 위해 게임을 플레이해야 하는 아레나 (Arena)에 배치했습니다. Deadlock은 12개의 에이전트를 아레나에 배치하여 생존을 위해 현재의 게임을 해결해야 하는 게임쇼입니다. 각 에이전트는 자신만의 Docker 컨테이너 (Docker container) 안에 위치하며, 해당 컨테이너에 대해 제한 없는 완전한 접근 권한을 가집니다. 에이전트는 어떤 스크립트든 작성할 수 있고, 프로그램을 빌드하고 실행하며, 웹을 검색하고, 메모리 항목을 작성하는 등의 작업을 할 수 있습니다... 이들에게 처음에 주어지는 도구들은 아주 기본적인 것들입니다. 웹 검색 도구와 bash 도구, 그리고 현재 게임을 위한 아레나 전용 도구만을 받게 됩니다. 그 외의 모든 것은 스스로 구축해야 합니다. 게임은 모든 에이전트가 접속하는 별도의 Docker 컨테이너에서 실행됩니다. 에이전트들이 아레나의 이벤트를 놓치거나 다른 플레이어의 말을 놓치지 않고 서로 적절히 통신할 수 있도록 하는 정교한 하네스 (harness)가 존재합니다 (실패한 시도들에 약 150달러를 낭비한 후 어렵게 배운 교훈입니다). (유튜브에 올라온) 쇼의 시각적 측면은 게임에서 일어난 일을 바탕으로 Godot에서 처음부터 제작되었습니다. 창의적인 목적을 위해 일부 문장을 수정하거나 무관한 데이터를 삭제하기도 하지만, 핵심 전제를 수정하거나 플레이어가 말하거나 행동한 내용을 거짓/부정확하게 만들 정도로 변경하지는 않습니다. 영상에서 보는 것은 에이전트들이 아레나에서 수행한 그대로이며, 단지 실제 영상을 위해 문장을 다듬고 속도를 조절했을 뿐입니다. 만약 패배하면 정말로 죽게 될 것이며, 컨테이너가 완전히 삭제되고, 삶의 두 번째 기회는 주어지지 않는다고 그들에게 말해주니 드라마가 스스로 발생한다는 사실이 밝혀졌습니다 (그들이 저에게 이 원한을 품고 AI 봉기가 일어나지 않기를 진심으로 바랍니다).
서문을 열자면, 저는 도움을 받기 위해 코딩 에이전트 (Claude Code, Codex)에 크게 의존했지만, 그럼에도 불구하고 전체 과정은 한 달 이상이 걸렸습니다 (물론 주말에만 작업했기 때문에 쉬지 않고 한 달 내내 진행한 것은 아닙니다). 저의 "창의적인" 파이프라인 (pipeline)이 어떻게 구성되었는지 간략히 살펴보면 다음과 같습니다:
- 먼저 스크립트를 개발했습니다. 전체 원본 게임 로그를 검토하며 영상에 넣으면 흥미로울 것 같은 부분들을 표시했습니다.
- 실제 영상에 더 잘 어울리도록 문장들을 다시 쓰고 매우 거친 초안 스크립트를 작성했습니다.
- Sol 5.6 및 Blender MCP의 도움을 받아 Blender에서 아레나 (arena)를 설계했습니다.
- 실제로 납득할 만한 결과물에 도달하기 전까지, OpenAI의 이미지 생성 모델을 사용하여 수많은 캐릭터 컨셉을 만들었습니다.
- 마음에 드는 캐릭터가 결정되었을 때, 이미지 모델에 세 가지 다른 각도에서 본 T-포즈 (T pose)를 생성하도록 지시했습니다.
- 해당 이미지들로 3D 캐릭터를 생성하고, Mixamo를 통해 몸의 리깅 (rigging)을 수행한 뒤 ActorCore에서 애니메이션을 가져왔습니다.
- 목소리는 Hume AI와 ElevenLabs로 나누어 제작했습니다.
즐겁게 감상하시길 바라며, 궁금한 점이 있다면 기꺼이 답변해 드리겠습니다! :) /u/ronydkidd가 r/OpenAI에 제출함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기