참고X
LLM 수학 능력 벤치마크 업데이트: OpenAI(오픈AI) 문제 #109 개선 수치 공개
LLM의 수학적 논리 한계와 개선 정도를 보여주는 사례. 모델 평가 및 신뢰성 판단 시 참고 자료로 활용.
요약
OpenAI 문제 #109(정수 곱셈)에 대한 세 번째 업데이트가 발표되었으며, 연구팀은 κ > 2⁻¹⁸ 영역에 진입했다고 밝혔다. 이번에 공개된 정확한 증거 값(witness)은 4.19 × 10⁻⁶으로, 이전 결과인 7.5 × 10⁻⁹ 대비 약 558배 향상된 성능이다. 이는 기존에 알려진 가장 강력한 공개 결과보다 약 2.2배 우수한 수치이다. 특히 초기 OpenAI 연구 결과와 비교하면 2¹⁶⁴배라는 획기적인 개선을 달성했다. 이번 업데이트를 통해 정수 곱셈 알고리즘의 효율성 지표가 한층 더 강화되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @SJ_Swapnil_Jain: We are publishing a third update to OpenAI problem #109 (integer multiplication), and we have now entered 2^-1x territory. κ > 2⁻¹
원문 보기 ↗