Qwen3-VL 8B vs GPT-5.6 문서 처리 성능 비교
특정 문서 분류 업무에서 저가형 오픈소스 모델의 가성비와 한계를 확인 가능한 벤치마크.
요약
최근 r/LLMDevs 커뮤니티에서 Qwen3-VL 8B Instruct(Q4_K_M)를 MacBook 환경에서 가동해 Claude Opus 5.5, Sonnet 5, GPT-5.6 Terra와 137개의 문서로 비교 벤치마크를 진행했다. 실험 결과 문서 전체 정답률은 Opus 89%, Sonnet 85%, Qwen3-VL 8B 59%, GPT-5.6 Terra 57% 순으로 나타났다. 특히 Qwen3-VL 8B는 IRS 양식(W-2)에서 32개 중 21개를 맞춰 GPT-5.6 Terra(7개)를 크게 앞섰다. 다만 인도 은행 명세서 분석에서는 DD-MM-YYYY 형식을 MM-DD로 잘못 읽는 등 날짜 형식 처리에서 한계를 보였다. 이번 테스트는 영수증, 1980~90년대 송장, IRS 양식 등 실무 데이터셋을 활용해 진행되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3-VL 8B on a MacBook vs Opus 5.5 / Sonnet 5 / GPT-5.6 on 137 messy documents: beat GPT-5.6 on tax forms, lost badly on Indian date formats
원문 보기 ↗