Nonobench: 49개 LLM을 이용한 논그램 퍼즐의 공개 벤치마크
요약
Nonobench는 LLM의 논그램(picross) 해결 능력을 측정하는 공개 벤치마크입니다. 표준 모드와 하드 모드로 구성되어 있으며, 모델이 주어진 단서만으로 그리드를 완성하도록 합니다. GPT-6 Astra가 표준 퍼즐을 모두 해결했으며, Claude Opus 5.5는 하드 모드에서 높은 성능을 보였습니다.
핵심 포인트
- Nonobench는 LLM의 논그램 추론 능력을 측정하는 새로운 벤치마크입니다.
- 해결률은 퍼즐 크기가 커질수록 급격히 떨어지는 경향을 보였습니다.
- GPT-6 Astra가 표준 모드에서 완벽한 해결 능력을 보여주었습니다.
- 하드 모드는 순수 논리만으로 풀기 어려운 난이도 높은 퍼즐로 구성되었습니다.
Nonobench는 LLM이 논그램(picross)을 얼마나 잘 해결하는지 측정합니다. 각 모델은 행과 열 단서를 한 번 받고 전체 그리드를 반환합니다. 도구 사용 불가, 퍼즐당 한 번 시도만 가능합니다.
방법:
- 표준 모드: 5x5부터 15x15까지의 30개 퍼즐 (Moyà-Alcover가 만든 Nonograms 데이터셋, CC BY 4.0에서 가져옴).
- 하드 모드: 단일 해답을 가지도록 확인된 무작위 20x20 퍼즐 10개. 이 중 5개는 순수하게 선형 논리만으로는 풀 수 없습니다. 무작위 채우기는 모델이 추측할 수 있는 그림 퍼즐을 피합니다.
- 총 130가지 변형으로, 추론 노력 수준별로 테스트되었으며 OpenRouter를 통해 실행되고 가능한 경우 각 연구실의 전용 엔드포인트에 고정되었습니다.
결과:
- 해결률은 85%(5x5)에서 46%(10x10)로, 다시 20%(15x15)까지 떨어지며, 각 모델이 최선을 다한 결과입니다.
- GPT-6 Astra는 표준 퍼즐 30개를 모두 해결했습니다. 하드 모드에서는 Claude Opus 5.5가 10개 중 8개를 해결했으며, 15개 모델은 아무것도 해결하지 못했습니다.
- 대부분의 모델이 논리가 어려워지기 전에 카운트를 잃었기 때문에, 하드 모드의 답변은 단일 문자열이 아닌 20개의 행 문자열 배열로 이루어져 있습니다.
한계점: 퍼즐당 한 번 시도만 가능하므로 개별 결과는 노이즈가 많습니다 (95% 신뢰 구간 표시).
사이트: https://www.nonobench.com
코드 (MIT): https://github.com/mauricekleine/nonobench /u/mauricekleine 제출 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/MachineLearning (hot)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기