← promppy_ 실시간 AI 뉴스
참고Reddit

단일 RTX 5090서 Qwen3.6 35B 모델 543 tok/s 구현한 'NInfer' 공개

자체 구축한 CUDA 기반 추론 엔진으로 로컬 환경에서의 모델 추론 속도를 획기적으로 개선함.

요약

NInfer는 단일 RTX 5090 GPU에서 Qwen3.6-35B-A3B 모델을 최적화하여 구동할 수 있는 C++/CUDA 기반의 추론 엔진을 오픈소스로 공개했다. 이 엔진을 사용하면 Qwen3.6-35B-A3B 모델이 65,536 토큰 완성까지 단일 요청 기준으로 초당 542 토큰(tok/s)의 속도를 유지할 수 있다. 개발자는 단일 GPU에서 추론 속도의 한계를 시험하기 위해 사용자 지정 양자화, 가중치 레이아웃 설계, 커널 융합 등 전체 파이프라인을 처음부터 직접 구축했다. 현재 엔진과 변환된 모델 아티팩트는 깃허브(GitHub)를 통해 누구나 사용할 수 있다. 이번 결과는 특정 하드웨어와 모델 환경에서 엔드투엔드 최적화가 어느 정도의 성능 향상을 끌어낼 수 있는지 보여주는 사례다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 543 tok/s single-request Qwen3.6-35B-A3B on one RTX 5090 over a 65K-token decode

원문 보기 ↗
다음 뉴스 →

중요미국 AI 안전 기관 CAISI 소장 3개월 만에 사임…규제 정책 불확실성 증폭

미국 AI 안전성 평가 기준의 방향이 흔들림. 미국 시장 진출·수출용 모델 규제 대응 재점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스