Show HN: 인간이 GPT-5를 9.8배 능가하는 비즈니스 시뮬레이터 공개
요약
GPT-5를 능가하는 비즈니스 시뮬레이터 'MAPs'를 공개하며 AI 에이전트의 한계를 입증했습니다. 이 벤치마크는 확률적 이벤트, 불완전 정보 등 복잡한 환경에서 LLM 에이전트들이 일관성 있게 비즈니스를 운영하기 어렵다는 것을 보여줍니다. 인간은 모델보다 훨씬 뛰어난 성능을 보였습니다.
핵심 포인트
- LLM은 도구 사용은 가능하나, 시스템 전체를 운영할 수는 없다.
- 복잡한 시간적/공간적 제약이 중요해지면 LLM의 작동 능력이 저하된다.
- AI CEO 역할을 위해서는 단순 기능 구현 이상의 통찰력과 적응형 계획이 필요하다.
- MAPs는 AI가 기업 수준 의사결정의 기본 요소를 갖추기 위한 중요한 벤치마크다.
안녕하세요 HN 커뮤니티에,
현재의 AI 시스템들이 실제로 사업을 운영할 수 있을까요?
LLM 에이전트들이 이미 전체 팀을 관리하고, 전체 소프트웨어 스택을 대체하거나 심지어 AI CEO 역할을 할 수 있다는 믿음이 커지고 있습니다.
그래서 저희는 이 가설을 평가하기 위해 통제되고 측정 가능한 환경을 구축했습니다.
저희가 왜 이런 벤치마크를 만들었을까요?
현대 기업은 불확실성이 높고 정보가 불완전한 역동적인 환경에서 운영됩니다. CEO는 지연된 결과, 인력/자원 트레이드오프, 그리고 수많은 실패 모드로 인한 점진적 쇠퇴에 직면해야 합니다.
만약 우리가 의미 있는 운영적 또는 전략적 결정을 내릴 수 있는 AI 시스템, 예를 들어 AI CEO를 원한다면, 이 역동성을 처리할 수 있어야 합니다.
그래서 저희가 하나 만들었습니다.
무엇을 만들었나요?
Mini Amusement Parks (MAPs)는 다음과 같은 특징을 가진 롤러코스터 타이쿤 스타일의 비즈니스 시뮬레이터입니다:
- 확률적 이벤트(Stochastic events)
- 불완전한 정보(Incomplete information)
- 직원 배치, 재고 보충, 유지보수
- 장기 계획 수립(Long horizon planning)
- 복리 운영 실패(Compounding operational failures)
- 자원 제약(Resource constraints)
- 결과에 영향을 미치는 공간 레이아웃(Spatial layout affecting outcomes)
여기서 플레이하고 리더보드에 도전해 보세요: https://maps.skyfall.ai/play (재미있습니다)
보기에는 단순한 게임처럼 보입니다. 하지만 그 밑바탕에는 단 하나의 질문에 답하기 위해 설계된 벤치마크가 깔려 있습니다:
에이전트가 시간이 지남에 따라 비즈니스를 일관성 있게 운영할 수 있는가?
무엇을 테스트했나요?
저희는 다음 항목들을 평가했습니다:
- 인간 (내부 및 외부 테스터)
- 여러 GPT-5 에이전트
- 추가 도구, 문서, 연습 모드(practice mode), 계획 스캐폴딩(planning scaffolds) 등이 추가된 변형 모델들 등.
저희는 의도적으로 모델들에게 유리하게 환경을 구성했습니다. 즉, 전체 문서화, 단계별 행동 인터페이스, 샌드박스 탐색 모드, 추가 관찰 정보, 여러 프롬프팅 전략 등을 제공했습니다.
결과는 어땠을까요?
인간은 에이전트를 훨씬 능가했습니다.
문서화, 도구 사용, 샌드박스 ‘실습’을 갖춘 가장 강력한 모델조차도 인간 성능의 10% 미만에 그쳤습니다.
실패 양상은 일관적이었습니다:
- 수익성 있는 업그레이드 대신 눈에 띄는 업그레이드를 추구함
- 유지보수, 인력 배치, 재고 보충을 무시함
- 노이즈에 과잉 반응함
- 장기 계획이 전무함
- 샌드박스 트레이닝은 종종 상황을 악화시킴
분명해졌습니다: LLM(대규모 언어 모델)은 도구를 사용할 수는 있지만, 시스템을 운영할 수는 없습니다. 무작위성, 시간, 공간적 제약이 중요해지면 작동을 멈춥니다.
이것이 왜 중요할까요?
다음과 같은 주장이 커지고 있습니다:
- LLM이 전체 회사를 운영할 것이다
- LLM이 CEO의 직업을 대체할 것이다
- LLM은 자율 에이전트가 될 수 있다
- LLM이 워크플로우를 엔드투엔드로 관리할 수 있다
MAPs는 정반대의 것을 보여줍니다.
비즈니스를 운영하려면 통찰력, 위험 모델링, 시간적 추론(temporal reasoning), 인과 이해(causal understanding), 불확실성 하의 우선순위 지정, 적응형 계획이 필요합니다.
이것들은 기능적이고 실제 AI CEO가 갖춰야 할 기본 요소이며, 현재 모델들이 정확히 무너지는 지점입니다.
LLM이 장난감 비즈니스를 운영할 수 없다면, 어떻게 실제 비즈니스에 신뢰를 줄 수 있을까요?
이 벤치마크는 AI 시스템이 기업 수준의 의사 결정과 AI CEO의 기본 요소를 보여주기 위해 실제로 무엇을 필요로 하는지 이해하기 위한 우리의 첫걸음입니다.
AI CEO는 챗봇도, 사고의 연쇄(chain of thought)도, 분명 에이전트 래퍼도 아니라 운영 지능(operational intelligence)의 진정한 시연입니다.
우리가 이것을 공유하는 이유는 다음과 같습니다:
- 커뮤니티가 모델들을 이겨보도록 도전하고 싶기 때문입니다.
- 벤치마크에 대한 비판을 받고 싶기 때문입니다.
- 가장 중요하게는,
AI 자동 생성 콘텐츠
본 콘텐츠는 HN Show HN (AI)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기