jevman: AI 의사결정 모델들이 Pac-Man을 플레이하다
요약
본 글은 여섯 가지 의사결정 모델(kev 1.13, Kev 4B, Clef, Clef Flash, GPT-6 Luna, Laya)을 사용하여 Pac-Man 게임 플레이 성능을 비교 분석한 연구 결과입니다. 각 모델의 평균 점수와 지연 시간(latency)을 측정하여 실시간 의사결정 능력을 평가했습니다. GPT-6 Luna가 가장 낮은 응답 속도(179ms)를 보였으며, jev 1.13이 가장 높은 평균 점수를 기록하는 등 모델별 성능 차이를 보여줍니다.
핵심 포인트
- 다양한 의사결정 모델의 실시간 게임 플레이 비교 분석.
- GPT-6 Luna가 가장 낮은 지연 시간(179ms)을 기록함.
- jev 1.13이 평균 점수에서 가장 높은 성능을 보임.
- 오픈 소스 리더보드를 통해 누구나 모델 테스트 가능.
지난주에 저는 Jev와 Kev를 비교하는 글을 올렸고, 그 이후로 OpenAI가 decisions 엔드포인트를 출시했으며, Cloudflare는 Clef를 출시했고, 많은 분들이 Laya에 대해서도 질문했습니다. 이번에는 여섯 가지 인기 있는 의사결정 모델들을 사용하여 Pac-Man을 플레이하게 함으로써 비교해 보았습니다: kev 1.13, Kev 4B, Clef, Clef Flash, GPT-6 Luna, 그리고 Laya입니다. 이들이 밀리초(ms) 내에 응답하기 때문에 실시간으로 게임을 플레이하는 것이 가능했습니다. 저희는 리더보드를 공개했고 저장소(repo)도 오픈 소스이므로, 누구나 자신만의 의사결정 모델(예: 로컬에서 실행하거나 어딘가에 호스팅한 자체 파인튜닝 모델)을 실행하여 리더보드에 참여할 수 있습니다.
| Model | Avg score | High score | Avg latency |
|---|---|---|---|
| jev 1.13 | 2,750 | 6,380 | 290 ms |
| GPT-6 Luna | 2,568 | 5,920 | 179 ms |
| Clef Flash | 2,538 | 4,260 | 256 ms |
| Clef | 2,476 | 4,820 | 398 ms |
| Kev 4B | 1,506 | 5,280 | 231 ms |
| Laya | 639 | 1,200 | 104 ms |
리더보드를 위해 각 모델을 100번 실행하여 평균 점수를 계산했으며, 여기에 95% 신뢰 구간(±2 표준 오차)을 적용했기 때문에 일부 모델들이 최고점에 동률을 이루었습니다. 또한 사용자 본인이 Pac-Man이 되어도 플레이할 수 있으며, 유령들은 jev, clef, Luna 또는 Laya 중 모두일 수도 있고, 여러 모델들이 각 유령을 맡아 번갈아 가며 제어할 수도 있습니다.
제출자: /u/facethef [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기