참고AI타임스
국내 AI 4사, '벤치맥싱' 의혹 공식 부인...평가 신뢰성 공방
국산 LLM 평가 논란에 대한 기업들의 대응. 평가 지표의 객관성 확보가 주요 과제로 부상.
요약
독자 AI 파운데이션 모델(독파모) 프로젝트 2차 평가를 앞두고 제기된 '벤치맥싱' 의혹에 대해 참여 4개사가 전면 부인하고 나섰다. SKT는 A.X K2 개발 과정에서 벤치마크 오염 방지를 최우선으로 고려했다고 밝혔으며, LG AI연구원, 업스테이지, 모티프테크놀로지스 역시 관련 의혹이 사실이 아니라고 일축했다. 이번 논란은 최근 열린 국제머신러닝학회(ICML 2026)에서 애프터쿼리 등 미국 AI 학계 및 기업들이 벤치마크 성능 부풀리기 문제를 제기하며 시작되었다. 각 사는 벤치마크 점수가 평가 보완책일 뿐 모델의 실제 영향은 미미하다는 입장을 보이고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 독파모 4개사, '벤치맥싱' 의혹 일축..."평가 보완책으로 영향 미미"
원문 보기 ↗