← promppy_ 실시간 AI 뉴스
참고팁Reddit

Qwen3.8 27B 로컬 최적화: 5090 환경서 480 tok/s 달성한 QAT 체크포인트 공유

QUASAR QAT 기술과 DFlash2를 활용해 로컬 모델 추론 성능을 극대화한 실전 사례입니다.

요약

최근 Reddit r/LocalLLM 커뮤니티에 Qwen3.8-27B 모델을 NVIDIA GeForce RTX 5090에서 실행한 벤치마크 결과가 공유되었다. 기존 NInfer 공식 양자화 모델 대신 QUASAR의 QAT full-NVFP4 체크포인트와 DFlash2 기술을 적용한 결과, JSON 출력 기준 초당 484 토큰(tok/s)의 속도를 기록하며 기존의 400 tok/s 대비 성능이 향상되었다. 또한 동일한 하드웨어 환경에서 VRAM 사용량은 30.8GB에서 27.0GB로 약 3.8GB 절감되었으며, 실제 에이전트 작업에서도 33k 토큰 평균 287 tok/s의 속도를 보였다. 퍼플렉서티(Perplexity) 성능은 약 1.9% 저하되었으나 실제 사용 시 체감되는 수준은 아닌 것으로 평가된다. 해당 모델은 Hugging Face를 통해 공개되었으며, NInfer 엔진 환경에서 테스트되었다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Qwen3.8 27B runs at ~480 tok/s on a single 5090

원문 보기 ↗

광고

다음 뉴스 →

중요美 법원, 구글 AI 오버뷰 상대 독점금지 소송 기각

AI 검색이 퍼블리셔 트래픽을 흡수해도 반독점 위반 아니라는 판단. 콘텐츠 사업 모델 재검토 신호.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스