참고Reddit
Nonobench: LLM의 논리적 추론 능력 검증을 위한 노노그램 벤치마크 공개 [P]
LLM의 논리 퍼즐 해결 능력을 측정하는 오픈 벤치마크. 모델별 순수 추론 성능을 비교해볼 수 있는 참고 자료.
요약
Nonobench는 49개 대형언어모델(LLM)의 노노그램(Nonogram) 퍼즐 해결 능력을 평가하는 오픈소스 벤치마크이다. 평가 방식은 도구 사용 없이 한 번의 시도로 전체 그리드를 완성하는 것으로, 5x5에서 15x15까지의 표준 모드와 난도가 높은 20x20 하드 모드로 구성된다. 평가 결과, 표준 모드에서 해결률은 5x5(85%), 10x10(46%), 15x15(20%)로 퍼즐 크기가 커질수록 급격히 낮아지는 경향을 보였다. 특히 GPT-6 Astra는 표준 모드 30개 퍼즐을 모두 해결하며 우수한 성능을 입증했다. 하드 모드에서는 Claude Opus 5.5가 10개 중 8개를 해결하는 등 모델별로 뚜렷한 추론 능력 차이를 나타냈다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Nonobench: an open benchmark of 49 LLMs on nonogram puzzles, public and open source [P]
원문 보기 ↗