연구: Jev 군집이 살인범을 잡을 수 있을까?
요약
본 기사는 작고 빠른 AI 에이전트(Jev)의 군집과 강력한 추론 모델을 결합하여 복잡한 탐정 게임을 설계했습니다. 이 실험은 단서를 수집하는 '분할' 단계와 이를 종합적으로 해석하고 결정하는 '추론' 단계의 중요성을 입증합니다. 결과적으로, 에이전트 군집만으로는 오류 확산에 취약하며, 강력한 리더(Reasoner)가 반드시 필요함을 보여줍니다.
핵심 포인트
- AI 탐정 사건은 분할 정복 문제로 접근해야 합니다.
- 작은 에이전트는 증거 수집(분할)에 적합합니다.
- 군집만으로는 오류 확산 위험이 크고, 강력한 추론기가 필수적입니다.
- 강력한 리더는 단서의 의미를 해석하고 최종 결정을 내리는 역할을 수행해야 합니다.
우리는 작고 빠른 AI 에이전트(Jev)의 군집이 단서를 모아 살인범을 지목할 수 있는지 묻는 간단한 질문을 던지기 위해 Sherlock Holmes 탐정 게임을 만들었습니다. 그렇지 않다면 무엇이 필요한가요? 설정
각 사건은 절차적으로 생성된 빅토리아 시대 런던입니다: 100개의 주소, 10명의 용의자, 그리고 모든 주소마다 하나의 단서(목격자, 발자국, 허위 정보 또는 거짓말). 탐정이 사건을 해결했다고 간주하려면, 사건 시간으로부터 12시간 이내에 올바른 범인, 동기 및 은신처를 지목해야 합니다. 게임에는 두 가지 역할이 있으며, 우리는 서로 다른 모델과 알고리즘으로 각 역할을 맡겼습니다: 추론하고 결정하는 Holmes (GPT6-Astra, Jev, 규칙 기반 휴리스틱 중 택일)와 수색하는 The Irregulars (Jev 에이전트, 규칙 기반 휴리스틱 또는 아무도 없음). 이는 세 가지 주요 탐정 구성을 제공합니다: Holmes (GPT6-Astra) + Jev 군집: GPT6-Astra가 221B Baker Street에 머물며 계획하고, 12명의 Jev 에이전트가 심부름을 수행하고 보고합니다. 고독한 천재 (The Lone Genius) (GPT6-Astra): 하나의 대규모 추론 모델이 택시를 타고 문을 두드리며 모든 것을 스스로 처리합니다. Jev 군집: 리더 없이 100명의 Jev 에이전트가 거주지 근처의 이웃들과 단서를 공유하고 투표하며, 30명이 동의하면 사건이 종결됩니다.
결과
탐정 표준 사례(거짓말 없음): 군집이 증거를 제공하는 동안 리더가 추론합니다.
프레임업 사례(누군가 거짓말함):
Holmes (GPT6-Astra) + Jev 군집: 96/100, 93/100
규칙 기반 Holmes + Jev 군집: 95/100, 0/100
고독한 천재 (The Lone Genius) (GPT6-Astra): 57/100, 59/100
Jev 군집 (리더 없음): 38/100, 42/100
배운 점
군집은 증거 커버리지를 제공하는 반면, 리더가 추론합니다. 작은 에이전트들이 병렬로 도시를 수색하고, 리더는 그 증거가 무엇을 의미하며 언제 고발할지 결정합니다. 군집만으로는 너무 일찍 동의합니다. 가장 빠르지만(중앙값 2.2 사건 시간, 실제 시간 약 9초), 그들이 동의하는 답변 중 대부분은 틀렸습니다: 몇몇 에이전트가 단서를 잘못 읽고, 이웃들은 자신감 있는 투표를 복사하며, 아무도 확인하기 전에 오류가 확산됩니다. 천재는 문을 두드리는 것이 부족합니다. 잘 추론하지만, 결정적인 단서는 종종 그가 도달하지 못한 주소에 있습니다.
시간과 방문 횟수가 두 배가 되면 91까지 올라가지만, 여전히 느리고 시간 제한을 넘깁니다. 정직한 증거의 경우, 간단한 리더만으로 충분합니다. 단지 단서 개수만 세는 규칙 기반의 홈즈(Holmes)는 비용은 매우 적게 들면서 GPT6-Astra와 (95 대 96) 일치합니다. 누군가 거짓말을 할 때는 강력한 리더가 필요합니다. 누명 씌우기 사건에서 살인범이 목격자들에게 뇌물을 주면, 개수 세기는 거짓말하는 다수를 따르게 되어 100개 중 0개를 해결합니다. GPT6-Astra는 누가 증거를 제공하고 왜 그런지 질문하며 93을 해결합니다. 우리의 핵심은 이렇습니다: 탐정 사건은 분할 정복(divide-and-conquer) 문제입니다. 빠른 에이전트는 분할 단계(증거 수집)에 적합하며, 조각들이 의견이 다를 때는 강력한 추론기(reasoner)가 필요합니다. 더 많은 내용은 저희 블로그에서 읽어보실 수 있습니다 (사건의 인터랙티브 리플레이 포함): https://snyhlx.github.io/the_irregulars_detective_game/blog.html?v=lmgame-holmes-game 코드 및 기타 게임: https://github.com/lmgame-org/Gaming-JevSwarm 이 저장소는 다른 환경에서도 동일한 설정을 가지고 있습니다: CPU 디버깅, 포식자 공격 하의 물고기 무리 행동(fish schooling), 꿀벌 군집 서식지 선택 등. 모든 게임은 프리셋이 적용된 하나의 런처에서 실행되며, 규칙 기반 플레이어들은 API 키가 필요 없습니다. 저희는 피드백을 받고 싶습니다. 특히 빠른 스웜과 느린 추론기가 도움이 될 수 있거나 실패할 수 있는 다른 게임에 대한 의견을 부탁드립니다. LMGame 팀 드림: https://lmgame.org/#/aboutus /u/No_Yogurtcloset_7050 제출 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기