바이두, 40페이지 문서를 한 번에 처리하는 'Unlimited-OCR' 공개
문서 전체를 문맥 손실 없이 로컬에서 처리 가능. 클라우드 OCR 비용 절감 대안으로 검토.
요약
Baidu가 40페이지 분량의 문서를 한 번에 처리할 수 있는 오픈소스 OCR 모델 'Unlimited-OCR'을 공개했다. 이 모델은 30억 개의 파라미터 중 추론 시 5억 개만 활성화하여 사용자 기기에서 100% 로컬로 구동이 가능하다. 기존의 페이지 단위 OCR과 달리 32K 컨텍스트 윈도우를 지원해 표, 수식, 읽기 순서를 보존하며 데이터를 구조화된 마크다운 형식으로 출력한다. 표준 벤치마크에서 93%의 정확도를 기록했으며 40페이지를 넘어서도 0.11 미만의 오류율을 유지한다. 기존 클라우드 기반 유료 서비스와 달리 무료로 로컬 환경에서 실행할 수 있다는 점이 핵심이며, 허깅페이스에서 212만 회 이상의 다운로드를 기록하고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @VaibhavSisinty: Baidu just open-sourced an OCR model that reads entire 40-page documents in one shot. It's called Unlimited-OCR. 3 billion paramet
원문 보기 ↗