← promppy_ 실시간 AI 뉴스
참고Reddit

듀얼 RTX 5060 Ti 환경에서 Qwen 3.8 27B 로컬 구동 가이드

소비자용 GPU 2개로 256k 컨텍스트의 Qwen 모델을 효율적으로 실행하는 하드웨어 설정과 vLLM 레시피 제공.

요약

최근 한 레딧 사용자가 듀얼 RTX 5060 Ti(각 16GB, 총 32GB VRAM) 환경에서 Qwen 3.8 27B NVFP4 모델을 구동하는 데 성공했다. 해당 환경에서 vLLM 0.30.0 버전을 활용해 비디오 입력을 제외한 Qwen 3.8 27B의 전체 256k 컨텍스트를 문제없이 실행했다. GPU 전력 제한을 150W로 설정했음에도 성능 저하 없이 원활한 구동이 가능했으며, 특히 구조화된 출력 시 132 tok/s의 디코딩 속도를 기록했다. FP8 KV 캐시를 적용하면 전체 컨텍스트 활용이 가능하며, Prefill 단계에서는 초당 약 4,000 토큰의 성능을 보였다. 상세한 측정 결과와 실행 레시피는 GitHub를 통해 공개되어 있어 RTX 5090 없이도 고성능 모델을 구동하려는 사용자들에게 유용한 사례가 될 것으로 보인다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Qwen 3.8 27B on dual RTX 5060 Ti - 130 tok/s - full 256k context

원문 보기 ↗

광고

다음 뉴스 →

속보샘 올트먼, GPT-6 'Sol'·'Luna' 예고… 5.6 대비 성능↑ 토큰 비용 절반

코딩·컴퓨터 조작 강화에 토큰당 가격 절반, 작업당 비용은 더 낮아 마이그레이션 검토 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스