듀얼 RTX 5060 Ti 환경에서 Qwen 3.8 27B 로컬 구동 가이드
소비자용 GPU 2개로 256k 컨텍스트의 Qwen 모델을 효율적으로 실행하는 하드웨어 설정과 vLLM 레시피 제공.
요약
최근 한 레딧 사용자가 듀얼 RTX 5060 Ti(각 16GB, 총 32GB VRAM) 환경에서 Qwen 3.8 27B NVFP4 모델을 구동하는 데 성공했다. 해당 환경에서 vLLM 0.30.0 버전을 활용해 비디오 입력을 제외한 Qwen 3.8 27B의 전체 256k 컨텍스트를 문제없이 실행했다. GPU 전력 제한을 150W로 설정했음에도 성능 저하 없이 원활한 구동이 가능했으며, 특히 구조화된 출력 시 132 tok/s의 디코딩 속도를 기록했다. FP8 KV 캐시를 적용하면 전체 컨텍스트 활용이 가능하며, Prefill 단계에서는 초당 약 4,000 토큰의 성능을 보였다. 상세한 측정 결과와 실행 레시피는 GitHub를 통해 공개되어 있어 RTX 5090 없이도 고성능 모델을 구동하려는 사용자들에게 유용한 사례가 될 것으로 보인다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen 3.8 27B on dual RTX 5060 Ti - 130 tok/s - full 256k context
원문 보기 ↗