← promppy_ 실시간 AI 뉴스
중요Google DeepMind

Google DeepMind, 프론티어 모델 대상 세계 최초 '이중맹검 평가' 시범 도입

벤치마크 오염으로 인한 성능 부풀리기 우려, 모델 평가 결과를 볼 때 검증 방식 확인 필요.

요약

구글 딥마인드가 AI 모델의 벤치마크 오염 문제를 해결하기 위해 세계 최초로 암호화된 환경에서의 이중맹검(double-blind) 평가 시스템을 도입했다. 이 시스템은 외부 평가 데이터를 암호화된 '박스' 안에 가두어 AI 모델이 테스트 전 문제를 미리 학습하여 성능을 조작하는 것을 원천 차단한다. 이번 평가에는 싱가포르 AI 안전 연구소, OpenMined, AVERI, MLCommons 등의 파트너가 참여하여 Gemini Flash Lite 모델을 대상으로 테스트를 진행한다. 구글은 내부 테스트의 한계를 극복하고 잠재적인 사각지대를 식별하기 위해 외부 기관과의 협력을 지속하고 있다. 이러한 방식은 프라이버시를 보호하면서도 AI 모델 평가의 무결성과 신뢰성을 높이는 데 기여할 것으로 기대된다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Piloting the world's first double-blind AI evaluations

원문 보기 ↗
다음 뉴스 →

중요OpenAI Codex, 한도 초과 시 별도 상한 백업 'Luna Reserve' 도입 정황

고성능 모델 소진 후에도 제한된 백업으로 작업 지속 가능. 남용 방지와 실사용 편의의 절충안.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

최신 뉴스