← promppy_ 실시간 AI 뉴스
참고Reddit

LLM 추론 능력 평가 벤치마크 'GoBench' 공개

바둑(Go) 게임을 활용한 추론 능력 측정 벤치마크. ARC-AGI와 높은 상관관계를 보임.

요약

GoBench는 9x9 바둑 게임을 활용해 LLM의 일반적인 추론 능력을 평가하는 새로운 벤치마크로, 무작위 수준부터 초인적인 수준까지 단계별로 구성된 KataGo 상대를 기반으로 성능을 측정합니다. 연구 결과 GoBench 점수는 ARC-AGI 2 결과와 0.83의 높은 상관관계를 보이며, 현재 LLM의 추론 성능을 측정하기에 매우 유효한 지표로 평가받습니다. 평가 결과 GPT-6 Astra는 최대 2500 Elo를 기록했으나, 4400 Elo에 달하는 최상위 KataGo 수준에는 미치지 못했습니다. 다만 코딩 도구와 2시간의 사전 준비를 거친 Codex with Astra의 경우 3560 Elo를 기록하며 성능이 크게 향상되는 모습을 보였습니다. GoBench는 현재 성능 포화 상태가 아니며, 상세 리더보드와 소스 코드는 공식 웹사이트 및 GitHub를 통해 확인할 수 있습니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 GoBench: Evaluating LLMs on the game of Go [R]

원문 보기 ↗

광고

다음 뉴스 →

중요DeepSeek-V4-Flash:0731, 일주일 뒤 지원 종료 예고

구버전 flash에 의존 중이면 dsv4.1-flash 등으로 조기 전환해 서비스 중단 방지 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스