OpenAI의 GPT-6.1 Sol 성능 과대포장 의혹 제기
마케팅 대비 실제 벤치마크 결과가 저조하다는 분석. 실사용 시 성능 체감이 다를 수 있음을 시사.
요약
OpenAI가 출시한 GPT 6.1 Sol 모델이 'Astra 수준의 지능을 5분의 1 가격에 제공한다'는 마케팅 문구와 달리 실제 성능은 기대에 미치지 못한다는 분석이 제기되었습니다. BridgeBench 테스트 결과, GPT 6.1 Sol은 기존 GPT 6 Sol과 동일한 비용임에도 처리 속도는 2배 느린 것으로 나타났습니다. 특히 시각적 렌더링 테스트인 'sunset ocean test'에서 바다를 거의 구현하지 못하는 등 낮은 성능을 보였습니다. 벤치마크 평가자는 해당 모델이 Astra 수준의 지능이 아닌, 기존 GPT 6 Sol에 강화학습(RL)을 일부 개선한 수준에 불과하다고 평가했습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @bridgebench: OpenAI is marketing GPT 6.1 Sol as "near-Astra intelligence for a fifth of the price." We ran it through the BridgeBench sunset oc
원문 보기 ↗