에이전트 평가 결과의 신뢰성 문제: 3회 반복 실험에도 37%가 일관성 부족
LLM 에이전트 평가 시 노이즈가 심함. 신뢰할 수 있는 결과를 얻으려면 반복 평가(replicates) 설계를 필수적으로 고려해야 함.
요약
최근 Reddit의 r/LLMDevs 커뮤니티에는 Haiku 4.5 모델을 사용하여 127개의 평가 작업을 3회 반복 실행한 결과, 동일한 설정임에도 47개의 작업에서 성공과 실패가 교차했다는 분석이 공유되었습니다. 실험 결과 127개 중 66개 작업만이 매번 일관된 결과를 보였으며, 노이즈 플로어는 5.4 포인트로 측정된 반면 테스트한 최적의 에디팅은 평균값을 1.6 포인트 이동시키는 데 그쳤습니다. 연구 중간에는 2회 반복 시 p값 0.004로 성능 퇴보로 보였던 작업이 3회 반복 후 p값 0.07로 변화하는 등 데이터의 불안정성이 확인되었습니다. 총 1,145회의 실행을 거친 작성자는 현재의 평가 도구로는 작은 변화를 감지하기 어렵다는 결론을 내렸습니다. 이번 사례는 에이전트 성능 평가 시 개별 작업의 결과를 신뢰하기 위해 몇 번의 반복이 필요한지에 대한 실무적 고민을 던져주고 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 We ran the same agent eval 3 times. 37% of the tasks both passed and failed.
원문 보기 ↗