LlamaIndex, 엔터프라이즈 문서 추출 성능 평가 'ExtractBench' 워크샵 개최
복잡한 문서 구조에서 모델별 추출 성능 차이와 벤치마크 설계 논리를 확인하고 추출 워크플로우를 최적화할 기회.
요약
LlamaIndex는 다양한 기업용 문서 환경에서의 데이터 추출 성능을 평가하기 위해 'ExtractBench'를 새롭게 공개했다. 이 벤치마크는 370개의 기업 문서, 67개의 문서 유형, 4,800페이지 이상을 대상으로 스캔된 양식, 복잡한 중첩 표, 병합된 헤더가 포함된 금융 보고서 등 까다로운 환경에서의 추출 성능을 테스트한다. LlamaIndex는 이번 테스트를 통해 기존 벤치마크가 놓치고 있는 데이터 추출의 어려움을 분석하고, VLM, 코딩 에이전트, 전문 API 간의 비용 대비 정확도 효율성을 비교했다. 심층적인 기술 분석 결과는 오는 8월 26일 오전 9시(PT)에 진행되는 기술 웨비나에서 Simon Suo LlamaIndex CTO가 직접 발표할 예정이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @llama_index: Every extraction API demos well on a clean invoice. But what about the scanned form, the nested table, the 40-page financial repor
원문 보기 ↗