참고X
GPT-6.1 Sol, 벤치마크 결과 공개…지능 수준 논란
독립 벤치마크상 성능 향상은 미미하다는 지적, 실제 모델 선택 시 주의 깊은 검증 필요.
요약
OpenAI의 새로운 모델인 GPT 6.1 Sol이 AI 성능 측정 플랫폼 BridgeBench에 등록되었습니다. OpenAI는 해당 모델을 'near-Astra intelligence' 수준의 지능을 갖췄다고 평가했습니다. 테스트 결과 GPT 6.1 Sol은 기존 GPT 6 Sol보다 3점 높은 점수를 기록했으나, GPT 6 Astra보다는 82점 낮은 성능을 보였습니다. 벤치마크 검증 과정에서 자체 평가 지표에서는 점수가 상승했으나 외부 독립 평가에서는 큰 차이가 없다는 점은 벤치마킹 최적화(benchmaxing)의 신호일 가능성이 제기됩니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @bridgebench: GPT 6.1 Sol is now on BridgeBench. OpenAI is calling it "near-Astra intelligence." Our results: 3 points better than GPT 6 Sol. 82
원문 보기 ↗