참고팁Reddit
Kimi K3 로컬 구동 성능: 768GB RAM 환경에서의 벤치마크
로컬 환경에서 Kimi K3 구동 시 성능과 파라미터 셋업 공유. 고성능 로컬 추론을 위한 하드웨어 가이드.
요약
Reddit의 r/LocalLLaMA 커뮤니티에서 Kimi K3 모델을 로컬 환경(홈랩)에서 구동한 테스트 결과가 공유되었다. 테스트 환경은 768GB DDR5 메모리와 2개의 5090 GPU를 탑재한 구성이다. pwilkin/llama.cpp의 kimi-k3-text 포크 버전과 HuggingFace의 GrEarl/Kimi-K3-GGUF Q2_K 퀀타이즈 모델을 사용했다. 대형 프롬프트 입력 시 프리필(Prefill) 속도는 50~70tps를 기록했으며, 디코딩 속도는 초당 약 4토큰(4t/s) 수준이다. 특이사항으로 디코딩 속도가 시간이 지날수록 점진적으로 상승하는 현상이 관찰되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 First Kimi K3 results on home lab ~ 4t/s
원문 보기 ↗