참고팁Reddit
RTX 3090에서 Qwen 3.8-27B 최적화: 커스텀 커널로 추론 속도 극대화
소비자용 GPU 환경에서 대형 모델을 고속으로 구동하기 위한 구체적인 커널 최적화 사례.
요약
RTX 3090 환경에서 Qwen3.8-27B 모델의 추론 속도를 최적화한 결과, prefill 속도는 2,000 tokens/s, decode 속도는 132 tokens/s를 달성했다. 이번 성능 향상은 커스텀 커널 도입을 통해 이루어졌으며, int8 양자화 상태에서도 fp32와 0.99997의 유사도를 유지하여 품질 저하를 최소화했다. 기존 4k 컨텍스트 기준 약 1,300 tokens/s였던 prefill 속도를 2,000 수준까지 대폭 끌어올린 것이 핵심이다. 관련 최적화 코드와 상세 내용은 GitHub 저장소(syv-ai/qwen38-27b-rtx3090)에서 확인 및 테스트할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I pushed Qwen3.8-27B to 2.000 prefill per second and 132 decode per second on A RTX 3090.
원문 보기 ↗