참고AI타임스
에포크 AI, AI 벤치마크 신뢰성 검증 착수
주요 벤치마크들의 데이터 오염이나 설계 결함을 감사하는 프로젝트가 시작되었습니다. 모델 평가 지표 해석 시 주의가 필요합니다.
요약
AI 모델의 성능을 평가하는 벤치마크 자체의 신뢰성에 의문이 제기되면서, AI 연구기관 에포크 AI가 벤치마크 검증 프로젝트인 ‘벤치마크 리뷰’를 시작했다. 에포크 AI는 AI 모델의 점수뿐만 아니라 평가 지표인 시험지 자체를 감사하고 검증하겠다는 계획이다. 이번 프로젝트의 초기 검토 결과에 따르면 조사 대상 15개 벤치마크 가운데 9개에서 결함이 발견되었다. 현재 4개만이 정상적으로 검증된 상태이며, 나머지는 문제점이 있는 것으로 나타났다. 이는 향후 AI 모델 평가 체계의 투명성과 객관성을 높이는 데 중요한 기준이 될 것으로 보인다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 에포크 AI, 벤치마크 검증 착수..."15개 중 9개 결함"
원문 보기 ↗