참고AI타임스
독파모 2차 평가 발표 임박…벤치마크 및 평가 방식 보완 목소리
국내 독자 모델 평가 기준에 대한 업계 우려입니다. 한국 AI 모델의 기술적 수준과 평가 생태계를 이해하는 데 유의미합니다.
요약
독자 AI 파운데이션 모델(독파모) 프로젝트의 2차 평가 결과 발표를 앞두고 평가 방식과 비교 기준에 대한 보완 의견이 업계에서 제기되고 있다. 2차 평가는 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점으로 구성되는데, 일부 벤치마크 지표의 반영 방식과 모델 체급 설정 기준이 미흡하다는 지적이다. 특히 벤치마크 40점 중 글로벌 지표인 아티피셜 애널리시스(AAII)의 9개 지표 반영률이 제각각이며 에이전틱(Agentic) 능력을 검증할 지표가 부족하다는 평가가 나온다. 업계 관계자들은 다양한 모델 체급을 고려한 정교한 비교 잣대와 평가 체계의 개선이 필요하다고 입을 모으고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 발표 임박한 독파모 2차 평가..."평가 방식·비교 기준 보완 필요"
원문 보기 ↗