← promppy_ 실시간 AI 뉴스
참고팁Reddit

Qwen3-VL 8B vs GPT-5.6 문서 처리 성능 비교

특정 문서 분류 업무에서 저가형 오픈소스 모델의 가성비와 한계를 확인 가능한 벤치마크.

요약

최근 r/LLMDevs 커뮤니티에서 Qwen3-VL 8B Instruct(Q4_K_M)를 MacBook 환경에서 가동해 Claude Opus 5.5, Sonnet 5, GPT-5.6 Terra와 137개의 문서로 비교 벤치마크를 진행했다. 실험 결과 문서 전체 정답률은 Opus 89%, Sonnet 85%, Qwen3-VL 8B 59%, GPT-5.6 Terra 57% 순으로 나타났다. 특히 Qwen3-VL 8B는 IRS 양식(W-2)에서 32개 중 21개를 맞춰 GPT-5.6 Terra(7개)를 크게 앞섰다. 다만 인도 은행 명세서 분석에서는 DD-MM-YYYY 형식을 MM-DD로 잘못 읽는 등 날짜 형식 처리에서 한계를 보였다. 이번 테스트는 영수증, 1980~90년대 송장, IRS 양식 등 실무 데이터셋을 활용해 진행되었다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Qwen3-VL 8B on a MacBook vs Opus 5.5 / Sonnet 5 / GPT-5.6 on 137 messy documents: beat GPT-5.6 on tax forms, lost badly on Indian date formats

원문 보기 ↗

광고

다음 뉴스 →

중요앤트로픽, 더 빠르고 저렴한 중급 모델 'Claude Sonnet 5.5' 출시

전작 대비 30% 빠르고 토큰 소모 감소. 코딩·문서 작업용 에이전트라면 비용·속도 재검토 가치 있음.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스