← promppy_ 실시간 AI 뉴스
참고Reddit

구형 V100 GPU에서 Qwen3.8-27B 218 tok/s 달성한 커스텀 추론 엔진

구형 하드웨어에서 최신 모델의 추론 속도를 극적으로 끌어올리는 최적화 기법.

요약

Reddit의 한 사용자가 2017년 출시된 GPU인 NVIDIA V100 32GB에서 Qwen3.8-27B 모델을 구동하여 218 tok/s의 추론 속도를 달성했다. 이 성과는 Qwen 모델 및 V100 전용 추론 엔진인 NInfer를 통해 구현되었으며, 여기에는 커스텀 Volta NVFP4 커널, CUDA 그래프, 가중치 스트림 재사용을 활용한 추론 검증 기술이 적용되었다. 일반적인 상황에서도 약 200 tok/s의 속도를 기록하며 구형 하드웨어에서 매우 높은 효율성을 보여주었다. 작성자는 NInfer의 추가적인 성능 개선 여지가 남아있다고 언급했으며, 관련 오픈소스 저장소(https://github.com/geoffwatts/ninfer-v100)를 공개하여 사용자들의 테스트를 독려했다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 218 tok/s Qwen3.8-27B on a single PCIe V100 32GB

원문 보기 ↗

광고

다음 뉴스 →

중요OpenAI, 말하면서 듣는 실시간 음성 모델 'GPT-Live-1' 공개…Yelp 예약 통화에 적용

발화 중 사용자 끼어들기·주제 변경 처리 가능. 콜센터·예약 음성봇 구축 시 검토 대상.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스