LlamaIndex, 문서 추출 성능 평가 'ExtractBench' 공개
장문 문서 추출 시 누락된 행을 잡아내지 못하는 모델의 고질적 문제를 지적. RAG 파이프라인 검증 시 참고 필요.
요약
LlamaIndex는 문서 추출 과정에서 발생하는 가장 치명적인 오류가 데이터 누락임을 지적하며, 이를 평가하기 위한 벤치마크인 ExtractBench를 공개했다. ExtractBench는 370개의 기업 문서와 14개 시스템을 활용하여 특히 '긴 리스트의 완결성'을 검증하는데, 최대 26,725행에 달하는 방대한 데이터 처리 능력을 테스트한다. 실험 결과 기존 최첨단 VLM들은 문서의 일부만 읽고 나머지를 포기하는 현상이 나타났으며, 긴 문서일수록 F1 점수가 8.9~35.8%까지 떨어지는 성능 저하를 보였다. 반면, LlamaIndex가 새롭게 선보인 Extract 계층인 'Agentic Plus'는 긴 문서를 한 번에 처리하지 않고 반복적으로 수행하여 96.1%의 F1 점수를 기록했다. 이 시스템은 문서 길이가 늘어나도 성능이 저하되지 않고 일관된 정확도를 유지하는 유일한 솔루션으로 평가받는다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @llama_index: The most dangerous document extraction failure isn't a wrong value. It's a missing row that looks like nothing is wrong. We releas
원문 보기 ↗