벤치마크 점수 조작? RLM 학습 데이터 오염 탐지 및 논의 확산
모델 벤치마크가 학습 데이터와 유사할 때 발생하는 점수 부풀리기 문제. 성능 지표 해석 시 데이터 오염 가능성 확인 필요.
요약
@a1zhang과 @lateinteraction이 발표한 RLM 논문은 프론티어 모델 학습의 이면을 지적하며 벤치마크 점수 조작 가능성을 경고했습니다. 실제 테스트 데이터가 아니더라도 테스트와 유사한 데이터를 학습에 활용하면 원하는 벤치마크 수치를 인위적으로 달성할 수 있다는 점이 핵심입니다. 공개 가중치 모델의 경우 학습 데이터나 강화학습 환경(rlenvs)을 투명하게 공개하지 않아 이러한 '데이터 오염'을 검증하기 어렵습니다. 저자들은 숨겨진 궤적(hidden trajectories)에 표준 NLP 거리 측정 지표를 적용하여 이를 식별하려는 초기 연구를 수행했습니다. 이번 연구 결과는 RLM이 학습 과정에서 관찰된 잠재 구조를 공유하는 미학습 작업으로 일반화될 수 있음을 뒷받침합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @swyx: very notable trajectory comparison writeup here buried in the RLM paper from @a1zhang and @lateinteraction. an open secret of "fro
원문 보기 ↗