참고Reddit
RAG 평가 프레임워크 'RAGnarok-AI' 오픈소스 공개
LLM 기반 RAG 평가의 신뢰성 문제 해결을 위해 실제 인간 평가 데이터를 구축하는 오픈소스 프로젝트.
요약
오픈소스 RAG 평가 프레임워크인 'RAGnarok-AI'의 메인테이너가 LLM 기반 자동 평가의 신뢰성을 검증하기 위한 연구를 시작했다. RAGnarok-AI는 로컬 LLM 심사위원을 활용해 검색 관련성, 충실도, 답변 관련성 및 완전성 등을 평가하는 도구다. 하지만 연구자는 LLM 심사위원의 판단이 과연 정확한지 의문을 제기하며, 자동 평가의 신뢰성을 검증하기 위해 인간이 직접 주석을 단 벤치마크 데이터를 구축하고 있다. 현재 개발자와 오픈소스 기여자를 대상으로 자동 평가 결과와 인간의 평가를 비교하는 연구 참여자를 모집 중이다. 이번 프로젝트는 RAG 시스템 평가의 객관성을 확보하려는 목적으로 진행된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Open-source RAG evaluation framework — looking for developers to help validate AI evaluation results
원문 보기 ↗