Kimi K3 모델, 80개 RTX 5090 기반 로컬 추론 성공
2.8T 파라미터 모델을 소비자용 GPU 클러스터로 20 tok/s 속도로 구동. 프론티어급 모델의 로컬 인프라 최적화 가능성 입증.
요약
Moonshot AI의 Kimi k3 모델(2.8T 파라미터)이 80개의 RTX 5090 GPU 환경에서 구동에 성공했다. 해당 설정에서 Kimi k3는 튜닝 전 상태임에도 초당 20토큰(20 tok/s)의 속도를 기록했다. 이번 시연은 HBM 없이 GDDR7 기반의 게이밍 GPU와 표준 이더넷만을 활용해 공식 MXFP4 가중치로 최첨단 AI 성능을 구현했다는 점에서 의의가 있다. 지난주 동일한 장비에서 GLM-5.2 모델을 실행했을 때 30 tok/s에서 110 tok/s까지 성능을 끌어올린 바 있어, 향후 Kimi k3의 속도 또한 개선될 전망이다. 이제 연구소나 스타트업, 대학에서도 가장 강력한 오픈 웨이트 모델을 직접 소유하고 미세 조정 및 에이전트 실행이 가능해졌다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @totheagi: we got the full Kimi K3, 2.8T params, running on 80x RTX 5090s. 20 tok/s single stream, day one, untuned. Last week we took GLM-5.
원문 보기 ↗