로컬 LLM 벤치마크: DeepSeek-V4-Flash-Vision vs Qwen3.8-Flash-Next
동일 양자화(Q8) 환경에서 속도 대비 실질 작업 완료 성능과 환각 발생률 비교 데이터 제공.
요약
최근 Reddit의 r/LocalLLaMA 커뮤니티에서 DeepSeek-V4-Flash-Vision(DS-V4-Flash-Vision)과 Qwen3.8-Flash-Next(Q3.8FN) 모델의 로컬 Q8_K_XL 양자화 성능 비교가 화제가 되고 있다. 테스트 환경은 2x StrixHalo 128GB 시스템에서 Llama(RPC) 추론 엔진을 사용했다. 성능 비교 결과, 순수 토큰 생성 속도는 DeepSeek-V4-Flash-Vision이 Qwen3.8-Flash-Next보다 약 40% 느린 것으로 나타났다. 그러나 전체 작업 완수 속도는 DeepSeek-V4-Flash-Vision이 2배 더 빨랐으며 할루시네이션 현상 또한 적게 관찰되었다. 반면 Qwen3.8-Flash-Next는 'xhigh' 모드에서 사실상 사용이 불가능했고, 'medium' 모드에서도 25분간 수행한 작업을 완료하지 못하는 등 안정성 측면에서 한계를 보였다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 DeepSeek-V4-Flash-Vision Q8 vs Qwen3.8-Flash-Next Q8
원문 보기 ↗