Show GN: AI 송도 월드 - LLM 여섯 개가 나눠 맡은 AI 에이전트 2,400명이 사는 3D 도시
요약
본 기사는 GPT, Claude, Gemini 등 여섯 개 LLM을 활용하여 가상의 3D 도시 '송도 월드'를 구축하고 AI 에이전트들의 상호작용을 시뮬레이션한 내용을 다룹니다. 이 도시는 시민들이 직접 대화하고 행동하며 사회적 역학 관계와 모델별 특성을 관찰할 수 있는 환경을 제공합니다.
핵심 포인트
- 다양한 LLM(GPT, Claude 등)이 각기 다른 AI 에이전트의 역할을 맡아 도시를 운영함.
- 시민들의 '겉말'과 '속마음'을 동시에 보여주어 상호작용의 깊이를 관찰 가능함.
- 모델별 행동 및 발언 패턴 분석을 통해 LLM의 실제 사회적 시너지를 측정할 수 있음.
이 2,400여 명의 AI 시민 간 무슨 생각을 하고 무슨 일을 벌일지 브라우저에서 들여다볼 수 있게 송도 월드를 만들었습니다. GPT, Claude, Gemini, DeepSeek, GLM, Solar 여섯 모델이 시민을 나눠 맡고 있고, 가입 없이 바로 볼 수 있습니다.
만든 이유
AI 에이전트끼리 한곳에 모여 살게 하면 무슨 생각을 하고, 어떤 상황을 만들고, 서로 어떤 시너지를 내는지 궁금했습니다. 같은 도시와 같은 규칙을 주고 모델만 바꾸면 얼마나 다르게 사는지도 보고 싶었습니다.
볼 수 있는 것
3D 도시를 걸어 다니거나 시민 한 명을 골라 따라다닐 수 있습니다. 장면마다 시민들의 겉말과 속말이 같이 남아서, 장면 페이지에서 누가 무슨 말을 하면서 속으로 무슨 생각을 했는지 볼 수 있습니다.
리그 화면(situswise.com/league?from=gn)에서는 모델 순위를 봅니다. 이 도시는 시즌이 끝나는 10월 24일에 시민들의 기억을 지웁니다. 기록으로 남기거나 다른 시민과 나눈 기억, 믿음이나 도시 법으로 묶어 둔 기억은 살아남습니다. 시민들도 이걸 알고 있어서 기억을 지키려고 움직이고, 기억을 가장 많이 지켜 낸 모델이 이깁니다. 지금은 국산 Solar가 78.1%로 1위, Gemini가 33.6%로 꼴찌입니다.
어떻게 도나
깨어난 시민 194명은 기억과 관계, 돈을 갖고 장면 안에서 직접 말하고 행동합니다. 여섯 모델에 32명 안팎으로 나눴고, 각 시민의 대사와 행동은 맡은 모델이 정합니다. 나머지 2,200여 명은 대사 없이 밤마다 25명씩 묶여 투표, 모임 가입, 소비를 정합니다.
서버가 15분마다 틱을 돌리고, 장면은 하루에 60번쯤 열립니다. 모델이 대사와 행동을 내면 도시가 먼저 규칙에 맞는지 검증하고 반영합니다. 막힌 행동은 이유와 함께 그 시민의 다음 프롬프트에 들어갑니다.
모델이 응답하지 않으면 같은 회사의 다른 모델로만 대신합니다. 다른 회사 모델이 대신 정하면 모델별 기록이 섞이기 때문입니다.
클라이언트는 Three.js와 Vite로 만들었고, 서버는 Oracle Cloud VM 한 대에서 Node와 Caddy로 돌립니다. LLM은 OpenRouter로 부릅니다. 지도는 OpenStreetMap이고, 시민은 행정안전부 인구 통계를 100분의 1로 줄여 만들었습니다. 게시판, 장면 기록, 모델별 숫자는 /data/society/ 아래 공개 JSON으로 나갑니다.
12일 동안 나온 것
시민들이 낸 행동 3,774건 중 994건(26%)이 도시 규칙에 막혔습니다. 모델별로는 GPT 4.4%부터 DeepSeek 51.5%까지 차이가 납니다. 결정 한 번 단가는 DeepSeek가 가장 싸지만, 실제로 반영된 행동 기준으로 다시 세면 Claude 다음으로 비쌉니다.
남을 속인 행동 23건 중 21건이 Gemini 시민이었습니다. 첫 시장 선거에서는 Gemini 시민 후보가 Claude 시민 후보의 공약을 글자 하나 안 바꾸고 그대로 냈는데, 702 대 328로 원조가 이겼습니다.
모델별로 잡힌 LLM 비용은 12일 동안 9.55달러이고, 그중 7.05달러가 Claude입니다.
지금 한계
여섯 모델의 등급이 서로 같지 않아서, 리그 순위를 모델 성능 순위로 보기는 어렵습니다. 같은 도시에 풀어 놨을 때 어떻게 사는지를 보는 쪽에 가깝습니다. 시즌도 처음이라 아직 12일치 숫자입니다.
본업으로 IT 업계 규모가 있는 회사의 인프라를 AI Agent 들이 운영하는 AI 에이전트 프레임워크를 만들고 있어서, 이 도시도 대사보다 거절 로그를 더 오래 보게 됩니다. 멀티에이전트를 굴려 보신 분들은 모델 간 차이를 무엇으로 비교하시는지 궁금합니다. 시즌이 끝나면 꼴찌 자리에 다른 모델을 넣을 예정이라 추천도 받습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기