중요Google DeepMind
Google DeepMind, 프론티어 모델 대상 세계 최초 '이중맹검 평가' 시범 도입
벤치마크 오염으로 인한 성능 부풀리기 우려, 모델 평가 결과를 볼 때 검증 방식 확인 필요.
요약
구글 딥마인드가 AI 모델의 벤치마크 오염 문제를 해결하기 위해 세계 최초로 암호화된 환경에서의 이중맹검(double-blind) 평가 시스템을 도입했다. 이 시스템은 외부 평가 데이터를 암호화된 '박스' 안에 가두어 AI 모델이 테스트 전 문제를 미리 학습하여 성능을 조작하는 것을 원천 차단한다. 이번 평가에는 싱가포르 AI 안전 연구소, OpenMined, AVERI, MLCommons 등의 파트너가 참여하여 Gemini Flash Lite 모델을 대상으로 테스트를 진행한다. 구글은 내부 테스트의 한계를 극복하고 잠재적인 사각지대를 식별하기 위해 외부 기관과의 협력을 지속하고 있다. 이러한 방식은 프라이버시를 보호하면서도 AI 모델 평가의 무결성과 신뢰성을 높이는 데 기여할 것으로 기대된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Piloting the world's first double-blind AI evaluations
원문 보기 ↗