로컬 LLM 최적화 기술 'FreeToken' 공개: 하드웨어 메모리 공유로 대형 모델 구동 지원
GPU/CPU/RAM을 유기적으로 활용해 VRAM 부족 문제를 해결. 저사양 하드웨어에서도 고성능 모델을 로컬에서 구동할 수 있게 함.
요약
FreeToken은 전체 모델을 VRAM에 적재해야 하는 기존의 한계를 넘어 GPU, CPU, 시스템 RAM을 지능적으로 활용하여 로컬 AI 구동 효율을 획기적으로 개선한다. 이 기술은 MoE 전문가 모델을 필요에 따라 동적으로 이동시키며, 일반 노트북(RTX 4060, 8GB VRAM)에서도 35B 모델을 초당 39토큰 속도로 실행할 수 있게 한다. 또한 고사양 게이밍 PC(RTX 5090)에서는 284B 규모의 DeepSeek 모델을 인터랙티브하게 구동하는 것이 가능하다. 이를 통해 사용자는 클라우드 의존 없이 로컬 하드웨어만으로 강력한 AI를 실행할 수 있어 API 비용 절감 및 데이터 보안 효과를 기대할 수 있다. 로컬 AI 분야의 중요한 소프트웨어적 돌파구로 평가받으며 사용자가 보유한 기기의 활용도를 극대화할 전망이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @mark_k: FreeToken could be a HUGE deal for local AI. Instead of requiring enough VRAM to hold an entire model, FreeToken intelligently use
원문 보기 ↗