LlamaParse, 문서 데이터 추출 자동화 기능 강화
문서 데이터 파싱 시 스키마 정의 없이 필드 추출이 가능해져 관련 파이프라인 개발 공수 대폭 절감.
요약
LlamaIndex가 문서 파싱 도구인 LlamaParse의 기능을 업데이트하여 W-2 양식 등 복잡한 문서를 처리하는 과정을 간소화했습니다. 기존에는 마크다운 변환 후 별도의 파이프라인을 통해 필드를 추출해야 했으나, 이제 processing_options.forms 옵션을 'enrich'로 설정하면 마크다운과 함께 필드명, 값, 체크박스 상태가 포함된 JSON 데이터를 즉시 반환합니다. 별도의 스키마 정의나 추가 API 호출 과정이 생략되어 데이터 추출 효율이 크게 향상되었습니다. 현재 이 기능은 모든 유료 플랜에서 베타 버전으로 이용 가능하며, 신규 가입 시 1만 개의 무료 크레딧을 제공합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @llama_index: Parsing a W-2 into markdown was always the easy part. Getting the fields out was a second pipeline: define a schema, map the field
원문 보기 ↗