← promppy_ 실시간 AI 뉴스
참고HF Blog

Hugging Face, 추론 속도 3.2배 높이는 LFM2.5-DSpark 공개

speculative decoding으로 추론 병목 해소. LLM 서빙 비용 절감과 성능 최적화가 필요한 엔지니어라면 도입 검토 권장.

요약

Hugging Face는 대규모 언어 모델(LLM) 추론의 메모리 병목 현상을 해결하기 위해 추론 속도를 최대 3.2배 향상시키는 DSpark 기술을 도입한 LFM2.5-DSpark를 공개했다. DSpark는 가벼운 초안 모델을 사용하여 후보 토큰을 생성하고 타겟 모델이 이를 검증하는 추론 최적화 기법으로, EAGLE-3 및 DFlash 등의 기존 기법을 발전시킨 형태다. 이번 모델은 SFT, 채팅, 코드, 함수 호출 등 다양한 데이터를 학습한 약 300M 파라미터 규모의 초안 모델을 활용하며, 5개 레이어와 9개의 블록 구성을 갖춘 어텐션 기반 구조를 채택했다. 특히 타겟 모델의 배포와 동일한 정확도를 보장하면서 추론 효율성을 높이는 데 초점을 맞췄다. LFM2.5용 DSpark 초안 모델은 llama.cpp를 즉시 지원하며 공식 코드베이스를 기반으로 구현되었다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Up to 3.2x Faster Inference with LFM2.5-DSpark

원문 보기 ↗
다음 뉴스 →

중요Cerebras, 'CS-4' 공개... 공정 변경 없이 추론 성능 2배 향상

GPT-OSS-120B에서 사용자당 4,400토큰/초. 초저지연 추론이 필요한 서비스라면 GPU 대안으로 검토 가치.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

최신 뉴스