참고팁Reddit
V100 환경에서 Qwen3.6 27B 초고속 추론 구현: 'v100-skinny' 커널 공개
구형 GPU(V100)에서도 최신 모델의 추론 속도를 극대화할 수 있는 커널 최적화 기법입니다.
요약
Reddit의 r/LocalLLaMA 커뮤니티에서 구형 NVIDIA V100 GPU를 활용한 새로운 최적화 커널 'v100-skinny'가 공개되어 화제다. 개발자는 Nvfp4 가중치를 sm70 아키텍처에서 효율적으로 처리하는 커널을 개발해 Qwen3.6 27B 모델 구동 시 366 t/s라는 놀라운 추론 속도를 달성했다. 이 속도는 특정 조건에서 가능한 수치로, JSON 구조화 생성 시에는 약 240 t/s, MTP 친화적인 코드 생성 시에는 약 200 t/s의 성능을 기대할 수 있다. 이번 프로젝트의 상세 내용과 실행 방법은 GitHub 저장소 'v100-skinny'를 통해 확인할 수 있다. 노후화된 V100 하드웨어를 활용해 최신 거대언어모델의 추론 성능을 극대화했다는 점에서 실무자들의 주목을 받고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 366 t/s Qwen3.6 27B NVFP4 on v100s
원문 보기 ↗