← promppy_ 실시간 AI 뉴스
참고Reddit

Qwen 3.8 27B, RTX 3090에서 82 tps 달성하는 최적화 설정 공개

W4A16 양자화와 KV 캐시 최적화로 RTX 3090에서 고성능 추론이 가능해짐. 로컬 LLM 환경 구축 시 참고.

요약

최근 한 개발자가 RTX 3090 환경에서 Qwen3.8-27b 모델의 추론 속도를 극대화한 최적화 방식을 공개했다. 해당 엔진은 250W 전력 제한 상태에서 단일 요청 시 82 tps, 64개 동시 요청 시 최대 417 tps의 성능을 기록하며 기존 ninfer 대비 최대 149% 향상된 속도를 보여준다. W4A16 양자화, FP8 KV 캐시, lm_head 및 embed_tokens의 INT8 양자화를 적용해 VRAM 사용량을 14.2GB까지 줄였으며 최대 192k 이상의 컨텍스트를 지원한다. BF16 대비 양자화 손실은 lm_head와 임베딩에서 0.6% 수준이다. 이 설정은 vLLM 기반으로 구동되며, 리눅스 환경에서 몇 가지 패치를 적용해 사용할 수 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Qwen3.8-27b on RTX 3090 - 82 tps single request, up to 672 tps peak

원문 보기 ↗
다음 뉴스 →

중요Anthropic, 월스트리트 금융 분석 워크플로우 통째로 오픈소스 공개

DCF·LBO·IC 메모까지 Bloomberg·FactSet 연동 에이전트로 공개. 금융권 AI 도입 벤치마크로 검토할 만함.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스