참고X
Scale AI(스케일AI), 'Humanity's Sixth Sense' 벤치마크 공개... GPT-6(지피티 6)-astra 성능 측정
일상적 시각 추론 능력 측정 벤치마크. 모델의 공간·인과관계·사회적 이해도 평가 기준 참고.
요약
Scale AI Labs는 일상적인 직관적 시각 추론 능력을 평가하는 새로운 벤치마크 'Humanity’s Sixth Sense(HSS)'를 공개했다. HSS는 이미지와 비디오를 포함한 522개의 오픈 엔드 과제를 통해 공간·인과 추론 및 사회적 이해도를 종합적으로 측정한다. 테스트 결과 인간은 93.1%의 정답률을 기록한 반면, 가장 강력한 모델인 GPT-6-astra는 53.6%에 그쳤다. 중간값을 기록한 모델들의 점수는 30.9% 수준으로, 현재 AI 모델과 인간의 시각 추론 능력 사이에는 상당한 격차가 존재하는 것으로 나타났다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ScaleAILabs: We’re introducing Humanity’s Sixth Sense, a new benchmark testing the intuitive visual reasoning people rely on every day. Across
원문 보기 ↗