Moonshot AI, 시각 지능 평가 위한 새로운 벤치마크 'PerceptionBench' 공개
시각적 인식 능력을 10개의 원자적 기능으로 분리해 평가하는 벤치마크. 모델의 시각적 추론 성능 검증 시 참고.
요약
문샷AI(Moonshot AI)가 멀티모달 모델의 시각적 인지 능력을 정밀하게 평가하기 위한 새로운 벤치마크 'PerceptionBench'를 공개했다. 기존 벤치마크와 달리 사전 정의된 기준이 아닌 최신 모델들이 실제 실패하는 지점에서 분석한 10가지 핵심 시각 인지 능력을 기반으로 설계됐다. 총 42개의 기존 벤치마크에서 나타난 모델들의 오류를 분석해 도출했으며, 복잡한 추론이나 외부 지식 없이 오직 시각적 관찰만으로 답할 수 있는 3,000개의 검증된 질문으로 구성됐다. 이번 벤치마크는 현재 문샷AI의 공식 블로그, GitHub, Hugging Face를 통해 확인할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @Kimi_Moonshot: We are releasing PerceptionBench, a benchmark that isolates visual perception and evaluates it as a set of atomic capabilities - d
원문 보기 ↗