LlamaIndex, 데이터 파싱 비용 최적화를 위한 'Just-in-Time OCR' 전략 제안
사전 전체 파싱 대신 필요 시점에만 파싱하여 비용과 속도를 최적화하는 2단계 파이프라인 구성 기법.
요약
LlamaIndex는 문서 처리 파이프라인에서 모든 페이지를 미리 파싱하는 기존 방식의 비효율성을 지적하며, 'Just-in-time OCR' 방식을 새로운 대안으로 제시했다. 2단계 파싱 전략의 첫 번째 단계인 'LiteParse'는 Rust 기반의 오픈소스로, 50개 이상의 문서 형식을 지원하며 레이아웃 인식, 표, 헤딩, 페이지 복잡도 등을 32초 만에 빠르게 처리한다. 두 번째 단계로 LlamaParse를 활용해 필요한 페이지만 정밀하게 파싱함으로써 셀 단위의 표 데이터, 바운딩 박스, 신뢰도 점수를 추출한다. 이 방식은 기존 pypdf나 pdftotext가 해결하지 못한 첫 번째 패스의 한계를 보완하고, 불필요한 전체 파싱 비용을 절감한다. 결과적으로 더 빠르고 경제적인 비용으로 에이전트가 데이터룸 내 정보를 효율적으로 탐색할 수 있는 환경을 구축할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @llama_index: just-in-time OCR is all the rage. most pipelines parse every page before anyone asks a question. for an agent working through an a
원문 보기 ↗