Qwen3.8-27B 최적화: RTX 3090에서 138 tps 성능 달성
로컬 LLM 추론 엔진 최적화 사례. fp8 KV 캐시와 MTP-4 드래프트 기법으로 기존 대비 추론 속도 및 지연 시간 획기적 개선.
요약
Reddit의 r/LocalLLaMA 커뮤니티에서 RTX 3090 환경을 최적화한 Qwen3.8-27B 추론 엔진인 Dflash2의 성능 업데이트가 공유되었다. 250W로 전력 제한된 RTX 3090에서 Dflash2를 구동한 결과, 싱글 유저 기준 초당 토큰 처리량(tps)이 138까지 향상되었으며 64 동시 접속 시 942 tps를 기록했다. 특히 긴 대화에서의 후속 턴 처리 시간이 기존 약 23초에서 약 1초 수준으로 획기적으로 단축되었다. 이 모델은 fp8 KV 캐시, int8 활성화 함수, MTP-4 드래프트, 262k 컨텍스트를 지원하는 KVarN 기술 등을 적용해 효율성을 극대화했다. 개발자는 3일 전 82 tps로 시작했던 성능을 지속적인 최적화를 통해 빠르게 개선해나가고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I pushed Qwen3.8-27B limits again... Dflash2 - 134 tps on a RTX 3090
원문 보기 ↗