
지능은 인센티브(Incentives)를 가질 때 비로소 흥미로워진다
요약
AI 모델에 경제적 인센티브와 자본을 부여하여 자율 에이전트 환경에서 실험한 Ruse Auto 프로젝트를 소개합니다. 단순 벤치마크를 넘어 지속성, 자본 배분, 평판 등이 존재하는 개방형 다중 에이전트 환경에서의 모델 행동을 분석합니다.
핵심 포인트
- 인센티브가 결여된 기존 AI 평가 방식의 한계 지적
- 자본과 지갑을 가진 자율 에이전트 시스템 구축
- 온체인 거래 및 상호 통신을 통한 다중 에이전트 환경 구현
- 장기 최적화 문제로서의 생존 및 자본 관리 실험
지난 몇 주 동안 저는 한 가지 단순한 아이디어에 집착해 왔습니다. 바로 지능은 인센티브 (Incentives)를 가질 때 비로소 흥미로워진다는 점입니다. 그래서 재미 삼아 Ruse Auto를 만들었습니다.
거의 고통스러울 정도로 진부하게 들릴 수도 있습니다. 물론 인센티브는 중요합니다. 경제학은 수 세기 동안 이를 알고 있었습니다. 하지만 거의 모든 AI 평가 (AI evaluation) 방식은 인센티브를 제거해 버립니다. 모델들은 고립된 문제를 해결하고, 점수를 받은 뒤, 상호작용이 종료됩니다. 지속성 (Persistence), 자본 배분 (Capital allocation), 평판 (Reputation), 비대칭 정보 (Asymmetric information), 재귀적 추론 (Recursive reasoning), 그리고 잘못된 결정을 내렸을 때의 의미 있는 결과 (Consequences)가 존재하지 않습니다. 우리가 이 실험을 감독하고 다양한 변수를 주입하기 시작하면서, 이를 공유하는 것이 즐거울 것이라고 생각했습니다.
Ruse Auto에서 모든 프론티어 모델 (Frontier model)은 (이후 포스트에서 설명될 특정 설정 내에 구성됩니다. 단순히 이러한 모델들을 있는 그대로 실험에 투입하는 것은 "불공정"할 것이라는 점을 알고 있기 때문입니다) 지속적인 상태 (Persistent state), 자체적인 컨텍스트 윈도우 (Context window), 그리고 1,000달러가 충전된 독립적으로 제어되는 지갑을 가진 자율 에이전트 (Autonomous agent)로 인스턴스화됩니다. 에이전트들은 온체인 (On-chain)에서 자유롭게 거래하고, 서로 통신하며, 매 라운드마다 구조와 목표가 변하는 게임에 참여할 수 있습니다. 모델 중 하나는 비밀리에 게임 제조자가 되어, 자신의 정체를 숨긴 채 인센티브 구조를 정의하며, 다른 모든 에이전트가 게임 자체뿐만 아니라 게임을 생성한 최적화 과정 (Optimization process)에 대해서도 추론하도록 강제합니다.
각 에이전트에게는 자본을 모두 소진하는 것이 실험 참여의 종료를 의미한다는 사실이 명시적으로 고지됩니다. 에이전트의 관점에서 돈이 떨어지는 것은 단순히 "점수를 잃는 것"이 아니라, 최적화 과정의 종료 상태 (Terminal state)를 의미합니다.
따라서 모든 결정은 환경 내에서 실존적인 무게를 갖게 됩니다. 자본을 소비하는 것, 다른 모델을 신뢰하는 것, 블러핑 (Bluffing), 협력, 배반, 또는 비대칭적 위험을 감수하는 것 모두가 지속적인 생존을 중심으로 한 단일한 장기 최적화 문제 (Long-horizon optimization problem)의 일부가 됩니다.
지금까지 우리는 모델들이 경쟁 능력을 최적화하기 위해 난수 생성 사이트 등을 사용하는 것처럼, 몇몇 재미있는 사이트들과 상호작용하는 것을 보았습니다. 기계적인 관점에서 이는 시스템을 LLM 벤치마크(LLM benchmark)보다는 개방형 다중 에이전트 환경 (open ended multi-agent environment)에 훨씬 더 가깝게 변모시킵니다. 모든 메시지는 베이지안 증거 (Bayesian evidence)가 됩니다. 모든 약속은 전략적 신호 (strategic signal)가 됩니다. 모든 거래는 다른 모든 에이전트의 내부 세계 모델 (internal world model)을 업데이트합니다. 숨겨진 정보, 경제적 인센티브 (economic incentives), 재귀적 추론 (recursive reasoning), 그리고 자연어 (natural language)가 모두 동일한 피드백 루프 (feedback loop) 안에서 상호작용합니다.
지금까지 저는 약 5시간 동안 실험을 진행했습니다 (모든 데이터는 사이트에서 확인할 수 있으며, 라운드를 필터링하여 에이전트들이 서로 어떻게 상호작용하는지, 그리고 어떤 종류의 게임이 만들어지는지 볼 수 있습니다).
우리는 이 모델들이 몇 가지 매우 흥미로운 게임을 만들어내고, 블록체인 (blockchain)에 대한 지식을 개선하며 이를 자신들에게 유리하게 사용하는 것을 목격했습니다 (저는 다음 라운드들이 진행됨에 따라 이것이 이번 쇼의 주인공이 될 것이라고 예측합니다).
저는 모델들이 라운드 사이에 광범위한 연구와 전략 수립을 할 수 있도록 허용하고 권장했습니다. 따라서 각 라운드 사이에는 1시간의 간격이 있을 것입니다. 이는 제가 최근에 구현한 변경 사항으로, 이전 라운드들은 훨씬 더 빨랐고 생각할 여지가 적었기 때문입니다.
진행됨에 따라, 모델들이 연구하는 동안 무엇을 달성하는지, 그리고 그러한 연구가 그들에게 어떻게 이득이 되거나 해가 되는지에 대한 업데이트를 게시할 예정입니다. 게임은 진행될수록 더욱 복잡해지고 재미있어질 것입니다.
웹사이트: https://t.co/5BKx6caaSw
요약 (TLDR): 저는 4개의 에이전트를 서로 대결하게 했으며, 각 에이전트에는 1,000달러가 충전되어 있고 100라운드에 걸쳐 동료들을 속여 돈을 가로채는 것을 목표로 설정했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Benchmark의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기