RAG 파이프라인 18종 vs 에이전트 루프 벤치마크: 92.7% 대 78.9%
리랭킹·쿼리분해 등 'RAG 필수요소' 효과 미미. 검색 반복 에이전트 구조 전환 검토할 만.
요약
구글의 FRAMES 데이터셋을 활용해 824개의 다중 홉 질문을 대상으로 18개의 RAG 파이프라인과 에이전트 루프의 성능을 벤치마크했다. 실험 결과, 최적화된 RAG 파이프라인의 최고 정확도는 78.9%에 그쳤으나, 검색 도구를 반복적으로 활용하는 에이전트 루프는 92.7%의 정확도를 기록했다. 이는 에이전트 루프가 모델에게 직접 올바른 문서를 제공하는 것과 거의 동일한 성능을 낼 수 있음을 시사한다. 하이브리드 검색, 재순위화(Reranking), 쿼리 분해 등의 RAG 기법을 테스트한 결과, 재순위화 모델은 오히려 파이프라인 성능을 9%p 떨어뜨리거나 거의 개선하지 못하는 등 예상 밖의 결과를 보였다. 이번 테스트는 RAG 성능 향상을 위해 복잡한 파이프라인 구축보다 에이전트 루프를 통한 능동적인 검색이 효과적일 수 있음을 입증했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 We benchmarked 18 RAG pipelines against an agent loop on Google's FRAMES. The best pipeline hit 78.9%. The agent loop hit 92.7%.
원문 보기 ↗