에이전트 장기 작업 수행 능력의 한계? METR 벤치마크 포화 가능성
기존 평가 지표가 에이전트의 실제 업무 지속성을 충분히 설명하지 못할 수 있다는 지적.
요약
METR Evals의 AI 성능 측정 지표인 'long horizons' 그래프가 지난 5월 이후 업데이트되지 않아 포화 상태에 도달했는지에 대한 의문이 제기되고 있다. 에단 몰릭(Ethan Mollick) 교수는 최근 X를 통해 해당 그래프의 갱신이 멈췄음을 지적했다. 하지만 다른 연구 결과들을 종합해 볼 때, Fable을 비롯한 최신 모델들은 이미 18주 이상의 업무를 효율적으로 수행할 수 있는 수준에 도달한 것으로 보인다. 이는 향후 GPT-6 등 차세대 모델에서도 유사하거나 더 높은 수준의 장기 과업 수행 능력을 기대할 수 있음을 시사한다. 현재의 평가 방식이 기술 발전 속도를 제대로 반영하지 못하고 있을 가능성이 있어, 새로운 평가 기준에 대한 논의가 필요한 시점이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @emollick: Is the @METR_Evals long horizons measure effectively saturated? No updates to the most famous graph of AI progress since May, but
원문 보기 ↗