Hugging Face, 추론 속도 3.2배 높이는 LFM2.5-DSpark 공개
speculative decoding으로 추론 병목 해소. LLM 서빙 비용 절감과 성능 최적화가 필요한 엔지니어라면 도입 검토 권장.
요약
Hugging Face는 대규모 언어 모델(LLM) 추론의 메모리 병목 현상을 해결하기 위해 추론 속도를 최대 3.2배 향상시키는 DSpark 기술을 도입한 LFM2.5-DSpark를 공개했다. DSpark는 가벼운 초안 모델을 사용하여 후보 토큰을 생성하고 타겟 모델이 이를 검증하는 추론 최적화 기법으로, EAGLE-3 및 DFlash 등의 기존 기법을 발전시킨 형태다. 이번 모델은 SFT, 채팅, 코드, 함수 호출 등 다양한 데이터를 학습한 약 300M 파라미터 규모의 초안 모델을 활용하며, 5개 레이어와 9개의 블록 구성을 갖춘 어텐션 기반 구조를 채택했다. 특히 타겟 모델의 배포와 동일한 정확도를 보장하면서 추론 효율성을 높이는 데 초점을 맞췄다. LFM2.5용 DSpark 초안 모델은 llama.cpp를 즉시 지원하며 공식 코드베이스를 기반으로 구현되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Up to 3.2x Faster Inference with LFM2.5-DSpark
원문 보기 ↗