단일 DGX Spark에서의 DeepSeek V4 Flash 성능 최적화 가이드
단일 DGX Spark 환경에서의 에이전트 성능 데이터 및 구동 레시피 공유. 로컬 LLM 추론 최적화 시 참고.
요약
DeepSeek v4 Flash 모델이 단일 DGX Spark 환경에서도 에이전트 워크플로우를 처리할 때 2x DGX Spark 환경의 FP8 버전보다 우수한 성능을 보이는 것으로 확인되었습니다. 해당 모델은 12개 동시 세션에서 최대 59 tok/s의 집계 처리량을 기록하며 단일 DGX Spark 구동에 최적화된 모델로 평가받습니다. 다만 처리 속도 측면에서는 2x DGX Spark 환경이 단일 환경보다 약 3배 빠르기 때문에 여전히 권장됩니다. 사용자 @MiaAI_lab은 단일 DGX Spark 환경에서의 원활한 구동을 위한 간단한 시작 및 종료 레시피를 공개하였습니다. 성능 테스트 결과, 12개 스트림까지의 총 처리량은 상승세를 보이나, 스트림당 토큰 처리 속도는 스트림 수 증가에 따라 26.7 tok/s에서 5.2 tok/s로 점진적으로 감소하는 경향을 나타냈습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @MiaAI_lab: Rejoice single DGX Spark owners! 💫 DeepSeek v4 Flash for single DGX Spark BEATS the 2x DGX Spark version on agentic workflows! 🤯
원문 보기 ↗