RTX 3090에서 Qwen3.8-Flash 구동기: VRAM 12GB 환경 최적화
12GB VRAM 환경에서 Qwen3.8-Flash-next를 실행하는 실질적인 하드웨어 구성과 성능 데이터. 로컬 모델 배포 시 참고할 만한 구체적인 벤치마크 사례.
요약
RTX 3090 환경에서 Qwen3.8-Flash-next 모델을 구동하여 160 tok/s의 프리필(prefill) 속도와 16 tok/s의 디코드(decode) 속도를 확인했다. 해당 설정은 12GB VRAM만 사용 가능하면 되며, 비전 처리는 GPU에서, 전문가는 호스트 RAM에서 분산 처리하는 방식을 활용한다. MTP(Multi-Token Prediction) 기능을 적용할 수 있으나 호스트 RAM 대역폭 소모로 인해 실제 디코드 속도는 오히려 저하되는 것으로 나타났다. kvarn5 양자화 모델은 q8/q8과 비교해도 KLD 차트에서 성능 차이가 거의 없어 효율적인 선택지다. 이 환경은 장시간 작업에는 적합하지만, 실시간 상호작용이 필요한 용도로는 속도 측면에서 한계가 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3.8-Flash on RTX3090 + 64GB RAM (but you only need 12GB VRAM)
원문 보기 ↗