llama.cpp용 DFlash 2 추론 가속 성능 벤치마크 결과 공유
로컬 LLM 추론 속도 개선을 위한 구체적인 수치 데이터 제시. 인프라 최적화 시 벤치마크 자료로 가치 있음.
요약
Inco AI가 공개한 DFlash 2와 llama.cpp PR을 Qwen 3.8 27B 모델 환경에서 벤치마킹한 결과, 100개의 실전 코딩 프롬프트 기준 2.26배의 성능 향상을 기록했다. DFlash 2 단독 사용 시 토큰 처리 속도는 초당 67.97개에서 153.91개로 증가했으며, 토큰 간 지연 시간은 14.27ms에서 6.02ms로 단축되었다. 여기에 n-gram 룩업 테이블을 추가 결합할 경우, 18턴 코딩 세션의 빌드 단계에서 최대 4.68배의 속도 향상(65.1 → 304.9 tok/s)이 확인되었다. DFlash 2 사용 시 약 2.7GB의 VRAM이 추가로 소모되지만, 자연스러운 중단(natural stop)을 지원한다는 장점이 있다. 이번 테스트는 RTX PRO 6000 환경에서 3일간 진행되었으며, 특정 사례에서는 최대 8배까지의 속도 개선 효과를 보였다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I benchmark DFlash 2 (PR build) in llama.cpp on Qwen 3.8 27B against all speculative methods for 3 days. 2.26x on 100 real coding prompts, 4.68x with one n-gram drafter on top. Up to 8x on specific cases.
원문 보기 ↗