참고팁Reddit
구형 V100 GPU에서 Qwen3.8-27B 218 tok/s 달성한 커스텀 추론 엔진
구형 하드웨어에서 최신 모델의 추론 속도를 극적으로 끌어올리는 최적화 기법.
요약
Reddit의 한 사용자가 2017년 출시된 GPU인 NVIDIA V100 32GB에서 Qwen3.8-27B 모델을 구동하여 218 tok/s의 추론 속도를 달성했다. 이 성과는 Qwen 모델 및 V100 전용 추론 엔진인 NInfer를 통해 구현되었으며, 여기에는 커스텀 Volta NVFP4 커널, CUDA 그래프, 가중치 스트림 재사용을 활용한 추론 검증 기술이 적용되었다. 일반적인 상황에서도 약 200 tok/s의 속도를 기록하며 구형 하드웨어에서 매우 높은 효율성을 보여주었다. 작성자는 NInfer의 추가적인 성능 개선 여지가 남아있다고 언급했으며, 관련 오픈소스 저장소(https://github.com/geoffwatts/ninfer-v100)를 공개하여 사용자들의 테스트를 독려했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 218 tok/s Qwen3.8-27B on a single PCIe V100 32GB
원문 보기 ↗