참고팁Reddit
16x GB10 클러스터에서 Kimi K3 전체 모델 구동 사례
거대 모델의 분산 추론 최적화 벤치마크 공유. 고성능 로컬 모델 구동 환경 구축 및 스케일링 전략 수립 시 참고.
요약
Reddit의 r/LocalLLaMA 커뮤니티에 Kimi K3 전체 모델을 16개의 NVIDIA GB10 클러스터에서 구동했다는 소식이 공유되었다. 해당 환경에서 Kimi K3 모델은 평균 20+tps, 최대 38tps의 생성 속도와 750tps의 프리필(prefill) 성능을 기록했다. 이는 dspark을 사용하여 Kimi K3 전체 모델을 클러스터에서 최초로 구동한 사례이다. 작성자는 현재 추가적인 성능 최적화 테스트를 진행 중이며, 준비가 완료되는 대로 vllm 이미지와 구동 가이드를 공개할 예정이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Kimi K3 full model running on 16x GB10 cluster at 20+tps
원문 보기 ↗