참고X
에단 몰릭 교수 "주요 AI 벤치마크, 성능 포화 상태 진입"
프론티어 모델의 능력이 기존 평가 지표들을 상회하기 시작함. 새로운 평가 기준에 대한 논의 필요.
요약
에단 몰릭(@emollick)은 METR long horizons 벤치마크가 사실상 포화 상태에 도달했다고 언급하며, AI의 발전 속도를 보여줄 새로운 정량적 지표의 필요성을 제기했다. 실제로 Epoch 연구 결과, 'Pre-Fable' 단계의 AI 에이전트가 이미 18주 분량의 인간 업무를 수행할 수 있음이 확인되었다. 현재 Frontier Math와 ARC-AGI 같은 주요 벤치마크 역시 이미 포화 상태에 이르렀다는 분석이 나온다. 몰릭은 이제 AI의 기하급수적인 발전 곡선을 효과적으로 증명할 수 있는 새로운 데이터와 벤치마킹 기준이 무엇인지 질문을 던졌다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @emollick: Now that METR long horizons is effectively saturated (Epoch found pre-Fable agents could do 18 weeks of human work), what is the b
원문 보기 ↗