DGX Spark 클러스터에서 Qwen3.8-Flash-Next 성능 최적화 사례
RDMA 설정 등 대규모 로컬 LLM 구동 시 성능 극대화를 위한 구체적인 인프라/네트워크 튜닝 팁.
요약
최근 Reddit의 r/LocalLLaMA 커뮤니티에서 NVIDIA DGX Spark 2대와 Qwen3.8-Flash-Next 모델을 활용하여 181 tok/s의 총 처리량(aggregate throughput)을 달성했다는 사례가 공유되었다. 512K 컨텍스트 및 2.8M KVC 환경에서 약 9개의 에이전트 세션이 엔진을 공유하는 조건으로 해당 수치를 기록했으며, 단일 스트림 디코딩 시에는 30~50 tok/s의 성능을 보였다. 하드웨어 구성으로는 GB10 Grace Blackwell과 128GB 통합 메모리를 갖춘 DGX Spark 2대를 ConnectX-7 케이블로 직접 연결하여 NCCL over RDMA(RoCE, 200 Gb) 및 TP=2 설정을 적용했다. 작성자는 TCP 폴백(fallback) 시 성능이 절반으로 떨어질 수 있으므로 NCCL 로그를 통해 네트워크 IB 사용 여부를 반드시 검증해야 한다고 조언했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Today I hit 181 toks/s (aggregate) on Qwen3.8-Flash-Next on 2x DGX Sparks
원문 보기 ↗