← promppy_ 실시간 AI 뉴스
참고Reddit

Nonobench: LLM의 논리적 추론 능력 검증을 위한 노노그램 벤치마크 공개 [P]

LLM의 논리 퍼즐 해결 능력을 측정하는 오픈 벤치마크. 모델별 순수 추론 성능을 비교해볼 수 있는 참고 자료.

요약

Nonobench는 49개 대형언어모델(LLM)의 노노그램(Nonogram) 퍼즐 해결 능력을 평가하는 오픈소스 벤치마크이다. 평가 방식은 도구 사용 없이 한 번의 시도로 전체 그리드를 완성하는 것으로, 5x5에서 15x15까지의 표준 모드와 난도가 높은 20x20 하드 모드로 구성된다. 평가 결과, 표준 모드에서 해결률은 5x5(85%), 10x10(46%), 15x15(20%)로 퍼즐 크기가 커질수록 급격히 낮아지는 경향을 보였다. 특히 GPT-6 Astra는 표준 모드 30개 퍼즐을 모두 해결하며 우수한 성능을 입증했다. 하드 모드에서는 Claude Opus 5.5가 10개 중 8개를 해결하는 등 모델별로 뚜렷한 추론 능력 차이를 나타냈다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Nonobench: an open benchmark of 49 LLMs on nonogram puzzles, public and open source [P]

원문 보기 ↗

광고

다음 뉴스 →

중요Google, AI 제출물 급증으로 오픈소스 버그 바운티 중단

AI 환각·허위 제보가 심사를 마비시키는 현실. 바운티·제보 창구 운영 시 AI 필터링 체계 필수.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스