참고AI타임스
구글, AI 벤치마크 오염 방지 위한 '이중맹검' 평가 도입
모델 평가 신뢰성을 높이기 위한 시도. 향후 업계 표준으로 자리 잡을지 주목해야 함.
요약
구글 딥마인드가 암호화 기술을 도입한 세계 최초의 AI 이중맹검(Double-blind) 평가 체계를 시범 운영한다고 27일(현지시간) 밝혔다. 이번 조치는 AI 모델이 평가용 문제 데이터를 미리 학습하여 성능 점수가 왜곡되는 '벤치마크 오염' 문제를 기술적으로 차단하기 위해 마련되었다. 그동안 AI 업계에서는 평가자가 벤치마크 문제를 공개할 경우 개발사가 이를 모델에 학습시킬 위험이 지속적으로 지적되어 왔다. 구글은 이번 새로운 평가 기술 보고서를 공개하며 기존 성능 평가 체계의 한계를 극복하겠다는 방침이다. 이는 향후 AI 모델의 객관적이고 정확한 성능 검증을 위한 새로운 표준으로 자리 잡을 것으로 기대된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 구글, 세계 최초 AI 이중맹검 평가 시범 운영…'벤치마크 오염' 방지 나선다
원문 보기 ↗