참고Reddit
단일 RTX 5090서 Qwen3.6 35B 모델 543 tok/s 구현한 'NInfer' 공개
자체 구축한 CUDA 기반 추론 엔진으로 로컬 환경에서의 모델 추론 속도를 획기적으로 개선함.
요약
NInfer는 단일 RTX 5090 GPU에서 Qwen3.6-35B-A3B 모델을 최적화하여 구동할 수 있는 C++/CUDA 기반의 추론 엔진을 오픈소스로 공개했다. 이 엔진을 사용하면 Qwen3.6-35B-A3B 모델이 65,536 토큰 완성까지 단일 요청 기준으로 초당 542 토큰(tok/s)의 속도를 유지할 수 있다. 개발자는 단일 GPU에서 추론 속도의 한계를 시험하기 위해 사용자 지정 양자화, 가중치 레이아웃 설계, 커널 융합 등 전체 파이프라인을 처음부터 직접 구축했다. 현재 엔진과 변환된 모델 아티팩트는 깃허브(GitHub)를 통해 누구나 사용할 수 있다. 이번 결과는 특정 하드웨어와 모델 환경에서 엔드투엔드 최적화가 어느 정도의 성능 향상을 끌어낼 수 있는지 보여주는 사례다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 543 tok/s single-request Qwen3.6-35B-A3B on one RTX 5090 over a 65K-token decode
원문 보기 ↗