JEV 모델을 활용한 LLM 인용 정확도 평가 경험기
LLM이 생성한 답변의 인용 근거가 실제 문헌과 일치하는지 JEV로 검증하는 실무 사례. RAG 구축 시 참고할 만한 평가 워크플로우.
요약
Reddit의 r/LLMDevs 커뮤니티에서 JEV를 활용해 웹 검색 기반 LLM의 인용 정확도를 테스트한 결과, 현재 모델들의 인용 능력에 심각한 한계가 있음이 드러났다. 테스트 결과 LLM이 한 작업당 평균 8개의 출처를 인용하지만, JEV가 모든 인용을 정확하다고 판단한 경우는 단 한 번도 없었다. JEV는 특히 LLM이 여러 출처의 정보를 조합하면서도 단 하나만 인용하거나, 질문의 의도와 맞지 않는 구식 정보를 가져오는 문제를 효과적으로 포착해냈다. 다만, 사용자는 JEV가 사용자 질문과 달리 몇 달 지난 기사를 인용하는 것을 즉시 식별하는 성능에 긍정적인 평가를 내렸다. 이러한 도구들이 향후 AI가 생성한 테스트 데이터를 검증하는 데 활용되어, 차세대 모델의 신뢰성을 높이는 데 기여할 것으로 기대된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 JEV is making me realize just how bad LLMs are at citations
원문 보기 ↗