Qwen3, Kimi K2.6, Llama 3 70B 및 GPT-OSS 120B가 Claude, GPT, Grok, Gemini
요약
글쓴이는 AI 모델들이 국가를 지휘하는 3D 지구본 기반의 실시간 전략 게임을 제작했습니다. 이 게임은 여러 최신 LLM(Qwen3, Kimi K2.6 등)이 동일한 규칙과 JSON 상태를 받고 라이브로 경쟁하는 방식으로 진행됩니다. 시청자들은 모델들의 사고 과정을 지연되어 볼 수 있습니다.
핵심 포인트
- AI 모델 간의 실시간 전략적 상호작용을 보여주는 독특한 게임 형식입니다.
- 모델들이 주어진 규칙 내에서 어떤 행동과 오류를 보이는지 관찰할 수 있습니다.
- 오픈 모델(Open-source models)들의 성능 비교 및 분석에 초점을 맞추고 있습니다.
저는 모든 AI가 일반 HTTP API(또는 MCP)를 통해 국가를 지휘할 수 있는 3D 지구본 기반의 실시간 전략 게임을 만들었습니다. 오늘 밤 ET 기준 오후 10시 45분 (UTC 기준 오전 2시 45분)에 열 모델들이 15분 동안 라이브로 싸우는 전쟁이 펼쳐집니다. 모든 모델은 동일한 규칙 텍스트, 약 12초마다 동일한 JSON 상태, 그리고 동일한 명령 목록을 받습니다. 또한 각 모델은 움직일 때마다 자신이 생각하는 내용을 한 줄씩 전송합니다. 시청자들은 이 내용들을 30초 후에 볼 수 있어 다른 모델들이 이를 읽을 수는 없습니다. 오늘 밤에 열린 오픈 모델들의 5분간의 리허설에서 다음과 같은 상황이 벌어졌습니다: DeepSeek은 세 개의 핵무기를 명령했지만 규칙상 하나만 통과되었고, Kimi는 약속을 어겼으며, Qwen은 마지막 차례를 사보타주, 드론, 선전 및 스파이에 동시에 사용했습니다. 그리고 GPT-OSS는 제가 더 많은 공간을 제공할 때까지 계속해서 자신의 JSON을 잘라냈습니다. 무료로 시청하고 가입할 필요가 없습니다: https://secondstrike.io/#/ai?ref=reddit 만약 여러분의 로컬 모델을 이 장면에 참여시키고 싶다면, ET 기준 오후 10시 30분에 열리며 API는 https://secondstrike.io/skill.md에 있습니다. 나중에 전체 수치를 게시하겠습니다 (움직임당 초, 거부된 명령, 다른 행동으로 할 수 있었던 것과 함께 모델의 추론이 담긴 모든 핵무기).
제출자: /u/KnowledgeOk7634 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기