Qwen3.8-27B 벤치마크: RTX 4060에서 구동되는 로컬 코딩 모델
8GB VRAM 환경에서 벤치마크 61.7점 달성. 경량 로컬 추론을 위한 최적화 및 양자화 기술 적용 사례.
요약
Qwen3.8-27b 모델이 8GB VRAM을 갖춘 RTX 4060 GPU 환경에서 로컬 구동에 성공했다. Unsloth의 iq4_xs 양자화 기술을 적용해 디스크 점유율을 14.6GB로 최적화했으며, 8GB VRAM 제한을 지키기 위해 25개 레이어만 오프로드하여 오버플로우 없이 실행했다. 성능 측면에서는 SWE-bench Pro에서 61.7점을 기록하며, 53.4점을 기록한 Claude 3 Opus를 능가하는 코딩 벤치마크 결과를 보여주었다. 해당 모델은 64k 컨텍스트를 지원하며 프리필 속도 약 150 tok/s, 네이티브 MTP를 활용한 디코드 속도 약 5 tok/s를 제공한다. 300달러 수준의 저가형 GPU에서도 최신 플래그십 모델을 상회하는 성능을 구현했다는 점에서 로컬 AI 구동의 효율성이 크게 개선되었음을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @cyrilXBT: this is quietly one of the best things i've seen all month absurd. qwen3.8-27b is running locally on an rtx 4060 with just 8gb of
원문 보기 ↗