Nonobench v1.2: 논어그램 퍼즐에 대한 43개 LLM 테스트 결과
요약
Nonobench v1.2는 논어그램 퍼즐(논리 퍼즐)을 활용하여 다양한 LLM의 추론 능력을 테스트한 후속 벤치마크입니다. 이 버전은 실행 과정과 모든 프롬프트/출력물을 공개하며, 최고 순위 모델들을 추가했습니다. GPT-6 Astra가 15x15 퍼즐에서 만점을 기록했고, DeepSeek V4 Pro와 Flash가 높은 점수를 받았습니다.
핵심 포인트
- Nonobench v1.2는 LLM의 추론 과정을 상세히 공개합니다.
- GPT-6 Astra가 15x15 퍼즐에서 완벽한 성능을 보였습니다.
- DeepSeek V4 계열 모델들이 오픈 웨이트 모델 중 높은 점수를 기록했습니다.
- Hard 모드(20x20)에서는 현재 모든 오픈 웨이트 모델이 어려움을 겪었습니다.
지난 1월 게시물(https://www.reddit.com/r/LocalLLaMA/comments/1q4i19c/benchmarking_23_llms_on_nonogram_logic_puzzle/)에 이은 후속 내용입니다. 해당 스레드를 바탕으로 v1.2가 제작되었습니다:
추론 과정이 실행마다 명시됩니다.
모든 프롬프트와 출력물이 공개됩니다.
현재 최고 순위의 비공개 및 오픈 웨이트 모델들이 모두 추가되었습니다.
누군가 Grok이 400자 답변을 잘못 계산하는 것을 발견했습니다. 알고 보니 이것이 대부분의 모델을 어렵게 하므로, Hard 모드 답변은 단일 텍스트 문자열이 아닌 행별로 이루어집니다.
결과:
- GPT-6 Astra: 15x15 퍼즐에서 첫 완벽한 실행으로 30/30점 기록 - 최고의 오픈 웨이트 모델: DeepSeek V4 Pro가 83%(공동 4위), DeepSeek V4.1 Flash가 총 $0.84로 77%를 기록했습니다. - Hard 모드 (무작위 20x20 퍼즐 10개, 각각 하나의 해답): Opus 5.5는 10개 중 8개를 맞혔습니다. 모든 오픈 웨이트 모델: 0/10
아직 OpenRouter에서만 사용 가능하여 로컬로 실행할 방법은 없습니다. PR(Pull Request)을 환영합니다.
nonobench.com (원시 데이터, API 및 코드는 GitHub에 있습니다)
제출자 /u/mauricekleine가 r/LocalLLaMA에 제출함
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기