참고팁X
Qwen3.8-27B, SGLang 지원으로 RTX 5090서 206 tok/s 달성
SGLang 최적화로 추론 속도 대폭 향상. 로컬 모델 서빙 성능을 극대화하려는 경우 테스트 필수.
원문 제목 @Alibaba_Qwen: Yes, we are back👑, with 206 tok/s on a single RTX 5090! Amazing Day-0 work from the SGLang team. Give it a try~@sgl_project
원문 보기 ↗