← promppy_ 실시간 AI 뉴스
참고Reddit

Kimi K3(2.8T) 벤치마크 및 배포 가이드: B300 8개 환경 성능

2.8T 모델 Kimi K3의 B300 기반 배포 및 벤치마크 결과. 대형 모델 호스팅 비용 및 성능 최적화 가이드.

요약

최근 Reddit 사용자가 8개의 B300 GPU를 활용하여 2.8T 파라미터 규모의 Kimi k3 모델을 Modal 환경에서 호스팅한 결과를 공유했다. vLLM과 tensor parallel 8, MXFP4 설정을 적용한 결과 초당 92토큰(tok/s)의 속도를 기록했으며, 출력 토큰 백만 개당 190달러의 비용이 발생했다. 부팅 시간은 1.56TB 로드와 CUDA 그래프 캡처를 포함해 약 27분이 소요되었고, 첫 토큰 생성 시간(TTFT)은 약 0.92~1.02초로 확인됐다. 대조적으로 Unsloth의 Dynamic GGUF 방식을 사용하여 8개의 A100-80GB GPU에서 1비트 양자화 모델을 구동했을 때는 초당 9토큰의 속도와 토큰당 620달러의 비용이 발생해 효율성이 낮았다. 해당 테스트의 상세 설정값과 Modal 배포 파일, 벤치마크 데이터는 원문 링크를 통해 확인할 수 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 I hosted Kimi K3 (2.8T parameters) using 8 B300s. 92 tok/s, $190 per million tokens

원문 보기 ↗
다음 뉴스 →

중요DeepSeek, 8월 23일부터 주말 피크·비피크 차등 요금 폐지

주말 저비용 시간대 배치 작업 돌리던 서비스라면 비용 구조 재계산 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스