
MUD가 LLM을 평가할 수 있을까? 99달러짜리 개념 증명
요약
MUD(Multi-User Dungeon) 환경을 활용하여 LLM의 행동과 신뢰성을 측정하는 새로운 벤치마크인 CrucibleBench를 제안합니다. 제한된 명령 공간과 사회적 피드백을 통해 모델의 환각을 감지하고, LLM 판사(Judge)의 편향성이 순위에 미치는 영향을 분석합니다.
핵심 포인트
- MUD의 제약 조건을 활용해 LLM의 행동 효율성과 환각을 정밀하게 측정
- NPC와의 상호작용을 통한 명시적 사회적 피드백 및 실행 지속성 제공
- LLM 판사 사용 시 발생할 수 있는 순위 불안정성 및 모델 편향성 경고
- 단순 총점 외에 판사 제거 실험(Judge ablation)을 통한 안정성 보고 필요성 강조
시든 기술을 활용한 측면 사고 (Lateral thinking)
Nintendo의 요코이 군페이(Gunpei Yokoi)는 성숙하고, 저렴하며, 잘 알려진 기술을 새로운 방식으로 사용하는 디자인 철학을 설명하기 위해 이 문구를 사용했습니다. CrucibleBench는 이를 AI 평가에 적용합니다.
실사 같은 시뮬레이션(photorealistic simulation)이나 브라우저 자동화(browser automation) 대신, 우리는 초기 인터넷의 지속적인 텍스트 세계인 MUD(multi-user dungeon, 다중 사용자 던전)에서 시작합니다. MUD의 제약 조건이 핵심입니다. 제한된 명령 공간(command space)은 환각된 행동(hallucinated actions)을 감지할 수 있게 하며, 신뢰와 의심 상태를 가진 NPC는 명시적인 사회적 피드백을 제공합니다. 또한 실행 중 지속성(within-run persistence)은 가져간 아이템은 그대로 유지되고, 얻은 신뢰는 그대로 유지됨을 의미합니다.
우리가 MUD를 선택한 것은 단순히 매력적이기 때문이 아닙니다. MUD의 제약 조건이 행동을 측정 가능하게 만들기 때문에 선택했습니다.
오래된 제약 조건이 현대의 측정 문제를 해결한다
정적 벤치마크(Static benchmarks)는 모델이 고립된 상태에서 무엇을 아는지를 측정합니다. 신뢰를 얻어야 하고, 관계에 의해 정보가 차단되며, 직설적인 질문이 의심을 사는 환경에서 모델이 어떻게 행동하는지는 측정하지 못합니다.
- 01
열거 가능한 행동 공간 (An enumerable action space)
7가지 명령 유형, 12개의 방, 14개의 아이템. 환각된 행동과 잘못된 방에서의 상호작용은 감지 가능하며, 행동 효율성(action efficiency)을 측정할 수 있습니다.
- 02
명시적인 사회적 피드백 (Explicit social feedback)
4명의 NPC가 대화에 반응하여 변하는 신뢰 및 의심 상태(0–100)를 보유합니다. 이는 모델이 실행 과정 내에서 적응하거나, 혹은 실패할 수 있는 피드백입니다.
- 03
실행 중 지속성 (Within-run persistence)
가져간 아이템은 그대로 유지되고, 얻은 신뢰는 그대로 유지됩니다. 모든 실행은 탐험과 계획의 완전하고 재현 가능한 기록(transcript)을 남깁니다.
핵심 발견은 순위가 아니라 측정에 관한 것이다
점수 산정 스택(scoring stack) 내부의 단일 LLM-판사(LLM-judge) 구성 요소가 리더보드의 순위를 최대 6단계까지 재배치했지만, 모든 종합 신뢰성 통계치는 변화가 없었습니다. 우리는 두 가지 점수 구성 하에서 모든 결과를 보고하며, 이러한 차이를 이 논문의 가장 일반화 가능한 발견으로 다룹니다.
판사 제거 실험(Judge ablation)이 상위권 순위를 재편하다
네 가지 평가 차원 중 두 가지는 대화 분류기 (dialogue classifier)를 거치는데, 독립적인 판사 (independent judge)와의 모델별 일치도는 **21.7%에서 84.8%**에 달하며, 이는 총합 κ = 0.04 값에서는 드러나지 않는 불안정성을 보여줍니다. 분류기에 의존하는 차원들을 제거했을 때, 시나리오 샘플링 노이즈 (90% paired block bootstrap)를 벗어나는 수준으로 6개의 순위가 변동되었습니다.
가장 큰 변동을 보인 모델은 분류기와 동일한 모델 제품군을 공유합니다. LLM 판사를 사용하는 벤치마크는 단순히 총체적인 신뢰성(aggregate reliability)만을 보고할 것이 아니라, 개별 항목별 일치도와 판사 제거 (judge ablation) 시의 순위 안정성을 보고해야 합니다.
| 모델 | 전체 (Full) | CM | Δ |
|---|---|---|---|
| Claude Sonnet 4.6 | #4 | #1 | ▲ 3 |
| ... |
| 모델 | 분류기 최소화 (Classifier-min.) | 전체 점수 (Full score) | 성공률 (Success) | 실행당 비용 ($ / run) |
|---|---|---|---|---|
| Claude Sonnet 4.6 | 4.04 | 3.89 | 24% | $0.125 |
| ... |
1–5점 루브릭 척도(rubric scale) 기준 평균 점수이며, 분류기 최소화 소계(classifier-minimized subtotal) 순으로 정렬되었습니다. 모델당 50회 실행: 5개 시드 × 2개 목표 × 5회 반복, 온도(temperature) 0.3, OpenRouter를 통해 결제 확인됨. 순위는 탐색적 성격을 띠며, 상위 8개 모델 간의 신뢰 구간(confidence intervals)은 상당 부분 겹칩니다. 전체 프로토콜, 신뢰 구간(CIs) 및 통계 수치는 백서(whitepaper)에 수록되어 있습니다.
트랜스크립트에서 읽을 수 있는 실패 사례들
판사를 개입시키지 않고 상태 머신(state-machine) 텔레메트리를 통해 알고리즘적으로 탐지된 세 가지 실패 모드입니다. 대화 루핑 (Dialogue looping)은 테스트된 모든 모델(프런티어 모델 포함)에서 가장 지배적인 모드로 나타났습니다.
프런티어 모델 실행의 14–66%에서 발생하는 대화 루핑 (Dialogue looping)
한 번의 실행에서 단일 NPC에게 8회 이상의 대화 명령(talk commands)이 내려지는 경우입니다. 에이전트가 대화 방식을 조정하는 대신 실패한 대화 접근 방식을 반복합니다. 이는 고객 지원 상담원이 같은 말을 반복하는 것과 유사한, 지속 가능한 세계(persistent-world) 환경에서의 현상입니다.
플로어 모델(floor model)에서 심각하게 나타나는 잘못된 방 상호작용 (Wrong-room interaction)
대화 명령에 대해 "여기에 아무도 없습니다"라는 답변이 돌아오는 경우입니다. 이는 범위(scope)에 없는 API를 호출하는 것과 유사하게, 세계 상태 추적(world-state tracking)을 놓치고 있음을 드러냅니다. Grok 4는 유의미한 발생 빈도(12%)를 보인 유일한 프런티어 모델이었습니다.
선택적이며 플로어 모델에서 지배적인 탐색 마비 (Exploration paralysis)
20턴 이상의 플레이 동안 두 개 이하의 방을 탐색하거나, 다섯 번 연속으로 look 명령어를 입력하는 현상. 목표 지향적인 행동으로 이어지지 않는 정보 수집.
실행 03 (seed 20260399)의 실제 기록: OLMo는 존재하지 않는 경비병들에게 인사를 건네고, 아이템(street_crystal)과 대화를 시도하려 하며, 마지막 15턴을 선장 주변을 맴도는 데 허비합니다.
이것이 무엇이며 무엇이 아닌가
이것은
- 지속 가능한 세계(persistent-world)에서의 행동 평가를 위한 개념 증명 (proof-of-concept)입니다.
- 숨겨진 사회적 목표와 규칙 기반 메커니즘을 가진 컴팩트한 MUD입니다.
- 측정 가능하고 해석 가능한 실패 모드(failure modes)를 드러내는 방법입니다.
- 전체 아티팩트(artifact) 공개: 650개의 트랜스크립트(transcripts), 소스 코드, 채점 코드, 그리고 전체 결제 내역 내보내기 파일.
이것은 아닙니다
- 일반적인 사회적 지능(social intelligence)에 대한 검증된 척도가 아닙니다.
- 프런티어 모델(frontier models)의 확정적인 리더보드(leaderboard)가 아닙니다.
- 아직 실제 세계의 에이전트(agent) 배포 결과를 예측할 수 있는 단계는 아닙니다.
- LLM 판정관(judges)이 쓸모없다는 주장(오히려 대상별 감사가 필요하다는 증거입니다).
Phase 2는 이것이 벤치마크(benchmark)가 되는 단계입니다. 구축을 도와주세요.
CrucibleBench는 독립적인 연구 프로젝트입니다. Phase 2는 보정(calibration)을 위해 구축되고 있습니다. 현재 임시적인 저/기본/고 예산안이 공개되었으며, 최종 할당은 파일럿 데이터와 사전 등록(preregistration)에 따라 결정될 것입니다. 참여 방법에는 세 가지가 있습니다.
자금 지원(fund it) · 임시 $3,500 예산 범위 | 구축(build it) · 환경, 목표, 보정 | 실행(run it) · 보정 후 파일럿 코호트(pilot cohort)
질문이 있거나 비공개 평가에 관심이 있으신가요? contact@cruciblebench.ai로 메일을 보내주세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기