참고팁Reddit
Qwen 3.8 27B, RTX 3090에서 82 tps 달성하는 최적화 설정 공개
W4A16 양자화와 KV 캐시 최적화로 RTX 3090에서 고성능 추론이 가능해짐. 로컬 LLM 환경 구축 시 참고.
요약
최근 한 개발자가 RTX 3090 환경에서 Qwen3.8-27b 모델의 추론 속도를 극대화한 최적화 방식을 공개했다. 해당 엔진은 250W 전력 제한 상태에서 단일 요청 시 82 tps, 64개 동시 요청 시 최대 417 tps의 성능을 기록하며 기존 ninfer 대비 최대 149% 향상된 속도를 보여준다. W4A16 양자화, FP8 KV 캐시, lm_head 및 embed_tokens의 INT8 양자화를 적용해 VRAM 사용량을 14.2GB까지 줄였으며 최대 192k 이상의 컨텍스트를 지원한다. BF16 대비 양자화 손실은 lm_head와 임베딩에서 0.6% 수준이다. 이 설정은 vLLM 기반으로 구동되며, 리눅스 환경에서 몇 가지 패치를 적용해 사용할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3.8-27b on RTX 3090 - 82 tps single request, up to 672 tps peak
원문 보기 ↗