Qwen 3.8-Flash-Next 벤치마크 및 로컬 구동 테스트
개인 벤치마크서 94% 달성. M4 Max 환경에서의 혼합 양자화 성능 및 아키텍처 지원 현황 확인.
요약
Reddit의 r/LocalLLaMA 커뮤니티에서 화제가 된 Qwen3.8-Flash-Next 모델은 M4 Max 128GB 환경에서 테스트 결과, 'cupel' 벤치마크 점수 94%를 돌파한 첫 번째 모델로 확인되었습니다. 테스트 환경에서 oMLX 및 lllama.cpp 추론 엔진을 사용했으며, 4비트 양자화 모델 구동 시 약 100GB의 메모리가 필요합니다. 해당 아키텍처는 아직 초기 단계로, oMLX의 K/V 캐싱 기능은 지원되지 않는 상태입니다. Qwen 3.8 27B 모델은 코딩 분야에서 뛰어난 성능을 보였으나, 일반 지식 부문에서는 Gemma 31B 및 Qwen 3.6 모델에 비해 다소 낮은 결과를 나타냈습니다. 실무적으로는 혼합 양자화 방식인 pipenetwork/Qwen3.8-Flash-Next-MLX-mixed-4_8bit 버전이 기존 4비트 양자화 대비 더 나은 성능을 보이는 것으로 평가되었습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3.8-Flash-Next: Time to Update Those Benchmarks
원문 보기 ↗