5080+4060 Ti 환경 로컬 LLM 멀티 GPU 추론 최적화 가이드
여러 GPU를 활용해 Qwen 모델 추론 속도를 200+ tok/s까지 끌어올린 성능 최적화 팁.
요약
최근 한 개발자가 32GB RAM을 탑재한 PC에서 Strata를 포크(fork)하여 Qwen3.8-Flash-Next 모델을 5080과 4060 Ti 두 개의 GPU에서 동시에 구동하는 데 성공했다. 기존 Strata는 저사양 RAM 모드에서 GPU를 하나만 사용하고 VRAM 부족분을 SSD에서 읽어와 성능이 제한적이었으나, 이번 개선으로 VRAM을 효율적으로 분산하고 두 카드가 동시에 디코딩 작업을 수행하도록 최적화했다. 해당 시스템(i9-14900KF, 32GB RAM)에서 256K 컨텍스트 테스트 결과, 기존 Strata 환경 대비 최대 5배 이상의 속도 향상을 기록했다. 특히 32K 프롬프트 환경에서 기존 333 tok/s였던 속도가 포크 버전에서는 1,940 tok/s까지 상승했다. 여기에 파인튜닝된 드래프트 레이어까지 추가할 경우, 더욱 향상된 추론 속도를 확보할 수 있음이 확인되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 200+ tok/s peaks with Qwen3.8-Flash-Next on a 5080 + 4060 Ti and 32 GB of RAM (Strata fork)
원문 보기 ↗