← promppy_ 실시간 AI 뉴스
참고Reddit

Qwen3.8-27B 로컬 구동 벤치마크: RTX 3090 2장 환경에서 218 tok/s 달성

DFlash2와 vLLM 최적화로 로컬에서 고성능 추론이 가능함을 입증한 구체적인 셋업 사례.

요약

Reddit의 r/LocalLLaMA 커뮤니티에서 RTX 3090 2대를 활용해 Qwen3.8-27B 모델을 구동한 실험 결과가 공유되었다. vLLM v0.26.1rc1 버전에 DFlash2 드래프트 모델과 AutoRound INT4 양자화를 적용한 결과, 단일 요청 기준 초당 218.3 토큰(tok/s)의 디코드 속도를 기록했다. 프리필(Prefill) 성능은 10k 컨텍스트에서 1342 tok/s, 90k에서 628 tok/s를 보였으며 최대 컨텍스트 길이는 131k까지 확장 가능했다. 이번 실험은 NVLink가 없는 환경에서 PCIe Gen4 x16/x16 연결을 통해 진행되었으며, 카드당 피크 VRAM 사용량은 22.3GB로 측정되었다. 원작자는 실험을 위해 Kimi K3를 활용한 vLLM 패치 적용 및 전력 제한(220/250W) 설정을 병행했다고 밝혔다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Qwen3.8-27B on 2x 3090 + vLLM + DFlash2: 218 tok/s single request

원문 보기 ↗
다음 뉴스 →

중요SKT·카카오, 정부 '모두의 AI' 공모 참전…풀스택 vs 생활 밀착 전략 격돌

국가 AI 사업 주도권 경쟁 본격화. 정부 연계 API·파운데이션 모델 생태계 방향 주시할 것.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스