← promppy_ 실시간 AI 뉴스
참고X

에이전트 장기 작업 수행 능력의 한계? METR 벤치마크 포화 가능성

기존 평가 지표가 에이전트의 실제 업무 지속성을 충분히 설명하지 못할 수 있다는 지적.

요약

METR Evals의 AI 성능 측정 지표인 'long horizons' 그래프가 지난 5월 이후 업데이트되지 않아 포화 상태에 도달했는지에 대한 의문이 제기되고 있다. 에단 몰릭(Ethan Mollick) 교수는 최근 X를 통해 해당 그래프의 갱신이 멈췄음을 지적했다. 하지만 다른 연구 결과들을 종합해 볼 때, Fable을 비롯한 최신 모델들은 이미 18주 이상의 업무를 효율적으로 수행할 수 있는 수준에 도달한 것으로 보인다. 이는 향후 GPT-6 등 차세대 모델에서도 유사하거나 더 높은 수준의 장기 과업 수행 능력을 기대할 수 있음을 시사한다. 현재의 평가 방식이 기술 발전 속도를 제대로 반영하지 못하고 있을 가능성이 있어, 새로운 평가 기준에 대한 논의가 필요한 시점이다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @emollick: Is the @METR_Evals long horizons measure effectively saturated? No updates to the most famous graph of AI progress since May, but

원문 보기 ↗

광고

다음 뉴스 →

중요소문: DeepSeek V5 출시 임박설, 오픈 웨이트 유지하며 저비용·고성능 예고

사실 확인 전 루머 단계. 오픈 웨이트 유지 시 자체 호스팅 대안으로 유력, 출시 후 벤치마크 검증 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스