LlamaIndex, 문서 추출 성능 평가 벤치마크 'ExtractBench' 공개
문서 데이터 추출 시 근거(Grounding) 정확도를 엄격히 평가. RAG 시스템 구축 시 신뢰성 검증 지표로 활용 권장.
요약
LlamaIndex가 문서 추출의 정확성과 근거 제시 능력을 평가하는 새로운 벤치마크 'ExtractBench'를 발표했습니다. 해당 벤치마크는 값과 인용 정보가 모두 일치하고 IoU 0.5 기준 단어 단위 박스가 정확할 때만 점수를 부여하는 엄격한 방식을 채택했습니다. 평가 결과, 기존 VLM과 코딩 에이전트는 근거 제시 기능이 전무했으며, 전문 API들조차 문서 길이가 길어지면 성능이 급격히 하락하는 경향을 보였습니다. 반면, LlamaExtract Agentic Plus는 페이지 단위 84.9%, 단어 단위 46.4%의 성능을 기록하며 업계를 선도했습니다. 특히 긴 문서에서도 87.1%의 높은 정확도를 유지하며 경쟁 모델들이 0%로 추락하는 것과 대조적인 모습을 보였습니다. LlamaIndex는 이번 벤치마크가 모든 추출된 값에 근거가 동반되어야 한다는 기준을 제시하는 이정표가 될 것이라고 강조했습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @llama_index: Most document extraction APIs can't tell you where a value came from. For ExtractBench, we scored grounding strictly: a field only
원문 보기 ↗