참고X
GPT-5.6 Sol, 멀티모달 벤치마크 ZeroBench에서 인간 수준 기록
ZeroBench에서 인간 수준(29.5%)을 상회하는 30% 기록. 고난도 멀티모달 추론 역량 평가 시 참고 지표로 활용 가능.
요약
AI 모델 GPT-5.6 Sol이 다중 모달 추론 벤치마크인 ZeroBench에서 30%의 점수를 기록했다. 이는 해당 벤치마크의 인간 기준치인 29.5%와 대등한 수준이다. ZeroBench는 공간 추론, 시각적 이해, 이미지 간 다단계 추론 등을 테스트하는 매우 난이도 높은 벤치마크로 알려져 있다. 이번 성과는 GPT-5.6 Sol이 복합적인 시각 정보 처리 및 추론 능력에서 인간 수준의 성능에 도달했음을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @haider1: okay, Wow GPT-5.6 Sol reaches 30%, roughly matching the 29.5% human baseline on ZeroBench, which is an extremely difficult multimo
원문 보기 ↗