← promppy_ 실시간 AI 뉴스
참고X

LlamaIndex, 문서 추출 시스템 벤치마크 'ExtractBench' 공개

수기/스캔 문서 인식 성능 비교 데이터. OCR 및 문서 처리 파이프라인 구성 시 참고할 만한 지표.

요약

LlamaIndex는 비디지털 환경의 문서 추출 시스템 14종을 대상으로 'ExtractBench' 벤치마크를 진행하여 각 시스템의 인식 사각지대를 분석했다. 실험은 1950년대 규제 서류, 수기 세금 양식, 팩스나 복사로 훼손된 문서 등 실제 현장 환경의 데이터로 이루어졌다. 분석 결과, 기존 시스템들은 특정 조건에서 성능 급락을 보였는데, Codex는 회전된 페이지에서, 특정 전문 API는 스캔 문서에서, Gemini 3.5 Flash는 스캔 즉시 정확도가 크게 하락했다. 반면 LlamaIndex의 신규 'Extract Tier, Agentic Plus'는 회전, 스캔, 수기 문서 전반에서 93.8~95.9%의 일관된 정확도를 기록했다. 이번 결과는 기존 벤치마크 데이터인 깨끗한 PDF와 달리, 현장 실제 데이터 처리 시 시스템마다 상이한 강점과 약점이 있음을 시사한다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @llama_index: Every document extraction system has a perception blind spot. We mapped them. For ExtractBench, we tested 14 systems on documents

원문 보기 ↗
다음 뉴스 →

속보'Gemini 3.7 Flash' 오늘 출시 예고 — 구글 딥마인드

미확인 X 게시글 기반 소문 단계. 공식 발표 전까지 API 도입 판단은 보류가 안전.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스