중요팁X
UC Berkeley·MIT, 오픈소스 추론 엔진 공개… llama.cpp 대비 1.46배 빠르다
RTX 5090에서 284B 모델 25tok/s, Ollama 대비 3배. 로컬 LLM 서빙 스택 재검토 가치.
요약
UC Berkeley와 MIT 연구진이 새로운 오픈소스 추론 엔진을 공개하여 업계의 주목을 받고 있다. 해당 엔진은 RTX 5090 시스템 환경에서 DeepSeek-V4-Flash 284B 모델을 초당 25토큰(tok/s)의 속도로 구동하는 성능을 기록했다. 이는 동일 테스트에서 llama.cpp 대비 1.46배 빠른 속도이며, Ollama로는 구동이 불가능했던 모델을 원활하게 서비스할 수 있는 수준이다. 또한, Qwen3.6-35B 벤치마크에서는 Ollama보다 최대 3배 빠른 추론 속도를 보였다. 고성능 모델의 효율적인 서빙을 지원하는 차세대 추론 솔루션으로 활용될 전망이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @Hesamation: UC Berkeley + MIT researchers open sourced a new inference engine and so far IT’S CRAZY: > runs DeepSeek-V4-Flash 284B at 25 tok/s
원문 보기 ↗