Kimi K3 로컬 구동 최적화: 2TB PMem200 기반 하드웨어 셋업 결과
초거대 모델 로컬 구동을 위한 최적화 환경과 PMem200 활용 벤치마크 데이터. 하드웨어 구성 시 참조.
요약
Reddit의 한 사용자가 2TB Intel Optane PMem 200(8x256 GB)과 Intel Xeon 8370C를 탑재한 시스템에서 Kimi K3 모델을 구동한 성능 테스트 결과를 공유했다. 해당 시스템은 Supermicro X12SPA-TF 메인보드와 256GB DDR4-3200 메모리를 기반으로 하며, fsdax 파일시스템 환경의 App Direct 모드에서 테스트가 진행되었다. Kimi-K3(UD-Q4_K_XL, 1405 GiB) 모델을 Memory Mode로 구동했을 때 PP(Prompt Processing)는 5.66 t/s, TG(Token Generation)는 1.05 t/s의 속도를 기록했다. 테스트를 수행한 사용자는 여러 구성 중 heat-ranked DRAM pin 방식이 K3 모델을 제외한 모델들에서 가장 우수한 성능을 보이며 빠른 모델 전환을 가능하게 한다고 밝혔다. 이번 결과는 고용량 저비용 Pmem 구성을 통해 거대 언어 모델을 로컬 환경에서 운용하려는 실무자들에게 유용한 참고 자료가 될 전망이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 2 TB of Cheep Pmem200 Dimms can Run Kimi K3 at tg128 ~ 1 t/s · pp512 5.6558
원문 보기 ↗