LLM 평가 파이프라인의 함정: 제시 순서에 따른 모델 판단 편향(Position Bias) 확인
LLM-as-a-judge 사용 시 A/B 선택지 순서만 바꿔도 판단이 10~12% 뒤집히는 현상 발견. 평가 자동화 시 필수 교차 검증 포인트.
요약
최근 LLM 평가 파이프라인에서 LLM-as-a-judge 방식이 널리 쓰이는 가운데, 입력 순서에 따라 평가 결과가 달라지는 편향성 문제가 확인되었다. Claude-Haiku-4.5와 Claude-Sonnet-5를 대상으로 답변 순서를 바꿔가며 테스트한 결과, 10~12% 확률로 결과가 뒤집히는 현상이 나타났다. 다만 명확한 정답이 있는 객관식 문항이나 승패가 확실한 비교군에서는 순서와 무관하게 평가가 일관되게 유지되었다. 흥미로운 점은 모델의 규모가 크다고 해서 반드시 이러한 순서 편향에 더 강한 것은 아니라는 사실이다. 실무자들은 LLM을 평가자로 활용할 때, 단순히 모델을 선택하는 것뿐만 아니라 입력 순서에 따른 편향을 보정하는 평가 설계가 필요하다는 점을 유념해야 한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 LLM-as-judge quietly ranks by position: swapping A/B flipped the verdict 10–12% of the time, and the bigger model wasn't better
원문 보기 ↗