← promppy_ 실시간 AI 뉴스
참고Reddit

Qwen3.8-27B 로컬 구동 벤치마크: RTX 5090 환경서 200 tok/s 달성

고성능 하드웨어 환경에서 최적화 엔진을 통해 로컬 LLM의 추론 성능을 어디까지 끌어올릴 수 있는지 보여주는 사례입니다.

요약

최근 Reddit의 r/LocalLLM 커뮤니티에서 RTX 5090(32GB) GPU와 NInfer 엔진을 활용한 Qwen3.8-27B(NVFP4) 모델 구동 사례가 주목받고 있다. 해당 환경은 Windows 11과 WSL2(Ubuntu) 기반으로 설정되었으며, Qwen3.8-27B Huihui abliterated 모델을 NVFP4 양자화 방식으로 실행한다. NInfer 엔진은 KV 캐시를 fp8로 처리하고 MTP(Speculative Decoding)를 적용하여 192K 컨텍스트를 지원하며, 코딩 작업에서 약 205 tok/s의 생성 속도를 달성했다. 프리필(Prefill) 성능 측정 결과, 8K 컨텍스트에서 약 9,000 tok/s, 64K에서는 약 6,200 tok/s, 128K에서는 약 4,500 tok/s의 높은 처리량을 보였다. 이번 테스트는 로컬 환경에서도 고성능 GPU와 최적화된 엔진을 통해 대규모 컨텍스트를 효율적으로 활용할 수 있음을 입증했다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Qwen3.8-27B NVFP4 5090 via NInfer on Windows/WSL2 - 205 tok/s coding, ~9k prefill, 192K ctx

원문 보기 ↗

광고

다음 뉴스 →

중요Mistral AI, 시스템 침해 주장 반박…"조사 결과 침해 증거 없음"

무단 접근 의혹 공식 부인. Mistral 모델·API 도입 서비스는 상황 모니터링 권장.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스