Qwen 3.8 27B 모델, 8GB VRAM RTX 4060에서 64k 컨텍스트 구동 성공
Unsloth의 IQ4_XS 양자화로 고성능 모델을 저사양 하드웨어에서 돌릴 수 있는 구체적인 셋업 사례.
요약
Qwen 2.5 32B 모델이 Unsloth의 새로운 IQ4_XS 양자화 기술을 통해 8GB VRAM을 탑재한 RTX 4060 GPU에서 로컬 구동이 가능해졌다. 해당 모델은 64,000 토큰의 컨텍스트 윈도우를 지원하며 디스크 용량은 14.6GB에 불과하다. 네이티브 MTP(Multi-Token Prediction) 기능을 활용해 Prefill 속도는 초당 150 토큰, Decode 속도는 초당 5 토큰을 기록했다. GPU 레이어 25개를 오프로드하여 메모리 초과 없이 실행되며, 양자화된 KV 캐시를 통해 메모리 점유율을 대폭 낮췄다. 약 300달러 수준의 보급형 GPU에서도 고성능 모델을 구동할 수 있다는 점에서 효율성이 크게 개선되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @cyrilXBT: INSANE. Qwen 3.8 27B is now running locally on an RTX 4060 with just 8GB VRAM. 64,000 token context window using Unsloth's new IQ4
원문 보기 ↗