참고Reddit
LLM 추론 능력 평가 벤치마크 'GoBench' 공개
바둑(Go) 게임을 활용한 추론 능력 측정 벤치마크. ARC-AGI와 높은 상관관계를 보임.
요약
GoBench는 9x9 바둑 게임을 활용해 LLM의 일반적인 추론 능력을 평가하는 새로운 벤치마크로, 무작위 수준부터 초인적인 수준까지 단계별로 구성된 KataGo 상대를 기반으로 성능을 측정합니다. 연구 결과 GoBench 점수는 ARC-AGI 2 결과와 0.83의 높은 상관관계를 보이며, 현재 LLM의 추론 성능을 측정하기에 매우 유효한 지표로 평가받습니다. 평가 결과 GPT-6 Astra는 최대 2500 Elo를 기록했으나, 4400 Elo에 달하는 최상위 KataGo 수준에는 미치지 못했습니다. 다만 코딩 도구와 2시간의 사전 준비를 거친 Codex with Astra의 경우 3560 Elo를 기록하며 성능이 크게 향상되는 모습을 보였습니다. GoBench는 현재 성능 포화 상태가 아니며, 상세 리더보드와 소스 코드는 공식 웹사이트 및 GitHub를 통해 확인할 수 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 GoBench: Evaluating LLMs on the game of Go [R]
원문 보기 ↗