← promppy_ 실시간 AI 뉴스
참고Reddit

V100 환경에서 Qwen3.6 27B 초고속 추론 구현: 'v100-skinny' 커널 공개

구형 GPU(V100)에서도 최신 모델의 추론 속도를 극대화할 수 있는 커널 최적화 기법입니다.

요약

Reddit의 r/LocalLLaMA 커뮤니티에서 구형 NVIDIA V100 GPU를 활용한 새로운 최적화 커널 'v100-skinny'가 공개되어 화제다. 개발자는 Nvfp4 가중치를 sm70 아키텍처에서 효율적으로 처리하는 커널을 개발해 Qwen3.6 27B 모델 구동 시 366 t/s라는 놀라운 추론 속도를 달성했다. 이 속도는 특정 조건에서 가능한 수치로, JSON 구조화 생성 시에는 약 240 t/s, MTP 친화적인 코드 생성 시에는 약 200 t/s의 성능을 기대할 수 있다. 이번 프로젝트의 상세 내용과 실행 방법은 GitHub 저장소 'v100-skinny'를 통해 확인할 수 있다. 노후화된 V100 하드웨어를 활용해 최신 거대언어모델의 추론 성능을 극대화했다는 점에서 실무자들의 주목을 받고 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 366 t/s Qwen3.6 27B NVFP4 on v100s

원문 보기 ↗
다음 뉴스 →

중요Mistral, 오픈 모델 호스팅·지역 엔드포인트 출시…AI 플랫폼 사업자로 도약

연산 지역을 유럽·미국 중 선택 가능. 데이터 주권·규제 대응 필요한 서비스면 API 검토 가치.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스