← promppy_ 실시간 AI 뉴스
참고Reddit

Windows 환경 멀티 GPU(RTX 5060 Ti)서 Qwen 3.8 27b 가속화 팁

PCIe P2P 미지원 윈도우 환경에서 custom PeerMailbox로 토큰 처리 속도를 2배 이상 개선한 사례.

요약

윈도우 11 환경에서 2개의 RTX 5060 Ti 16GB를 활용해 Qwen3.8-27B NVFP4 모델을 구동하는 최적화 사례가 공유되었습니다. 해당 환경은 WDDM 제약과 GPU 간 P2P 통신 불가, 불균형한 PCIe 연결이라는 불리한 조건을 가졌습니다. 초기에는 호스트 스테이징 방식의 AllReduce 오버헤드로 인해 16.37~32.58 tok/s의 저조한 성능을 보였습니다. 이를 개선하기 위해 윈도우/WDDM 환경에 맞춘 커스텀 'pinned-host PeerMailbox' 전송 프로토콜을 도입했습니다. 그 결과, 별도의 하드웨어 변경 없이 최대 76.65 tok/s의 성능을 달성하며 비최적화 환경에서의 멀티 GPU 추론 효율을 높였습니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Windows 11 + 2× RTX 5060 Ti 16GB: Qwen3.8-27B NVFP4 at up to 76.65 tok/s — despite no GPU P2P

원문 보기 ↗

광고

다음 뉴스 →

중요삼성SDS, '다차원 AI 풀스택' 전략 발표…AI 보안·피지컬 AI로 확장

엔터프라이즈 AX 도입-성과 간극 해소가 핵심 화두. 국내 대기업 AI 전략 벤치마킹 참고.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스