Eval이 '답안지'가 되지 않게 하려면? 프롬프트 튜닝의 함정 피하기
검증셋 오염 방지를 위한 의미론적 중복 제거와 '보이지 않는' 홀드아웃 셋 구성의 중요성.
요약
최근 레딧(Reddit)의 r/PromptEngineering 커뮤니티에서는 고정된 '골든 세트(Golden set)'를 반복 사용하여 프롬프트를 튜닝할 때 발생하는 '과적합(Overfitting)' 문제가 핵심 의제로 논의되고 있다. 테스트 데이터와 학습 데이터 간의 유사도가 높을 경우, 모델이 프롬프트의 지시사항을 이해하기보다는 특정 포맷을 암기해 성능이 부풀려지는 현상이 발생한다. 이를 방지하기 위해 프롬프트 작성자가 확인할 수 없는 '홀드아웃 세트(Holdout set)' 구축과 의미론적 중복 제거(Semantic deduplication)를 우선 수행해야 한다. 또한 다양한 정답이 존재하는 작업에는 'Pass at k' 방식을 적용하되, 초기 답변의 품질이 숨겨지지 않도록 주의해야 한다. 실무적 평가의 신뢰도를 높이기 위해서는 단순 점수보다는 신뢰 구간(Confidence intervals)을 고려하고, 실제 실패 사례를 기반으로 한 적대적 슬라이스(Adversarial slices)를 추가하는 전략이 필요하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 How do you stop evals from becoming a cheat sheet for the prompt?
원문 보기 ↗