'JEV-as-a-Judge': LLM 평가 비용 절감을 위한 라우팅 전략
JEV를 활용해 판단 신뢰도에 따라 에이전트 평가를 라우팅하면 GPT-6급 정확도를 유지하면서도 평가 비용을 대폭 절감 가능.
요약
최신 연구 논문 'JEV-as-a-Judge: Accept When Confident, Escalate When Unsure'는 LLM 평가 시 JEV(Joint Evaluation Verifier)를 활용한 효율적인 판단 프레임워크를 제시했다. JEV는 저비용의 1차 심사관 역할을 수행하며, 답변에 대한 판정과 함께 해당 판정의 확신도 점수를 산출한다. 확신도가 높은 경우에는 JEV의 결과를 그대로 채택하고, 확신도가 낮은 경우에는 더 강력한 고성능 LLM으로 평가를 이관한다. 이러한 라우팅 방식을 통해 GPT-4 수준의 정확도를 약 99% 유지하면서도 전체적인 평가 비용을 대폭 절감할 수 있다. 고비용의 LLM을 모든 평가에 사용하는 대신, 실무적으로 비용 효율적인 평가 파이프라인을 구축할 수 있는 방법론이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @askalphaxiv: "JEV-as-a-Judge: Accept When Confident, Escalate When Unsure" This paper shows you can just use JEV for every evaluation instead o
원문 보기 ↗