UC Berkeley, 고속 로컬 추론 라이브러리 'FreeToken' 오픈소스 공개
기존 Ollama 대비 2~4배 빠른 추론 성능 제공. 로컬 LLM 구동 환경 구축 시 생산성 향상 기대.
요약
UC Berkeley Sky Lab에서 로컬 AI 추론을 가속화하는 'FreeToken'을 오픈소스로 공개했다. 이 기술을 활용하면 단일 RTX PRO 6000 GPU에서 753B 파라미터 규모의 GLM-5.2 모델을 초당 14.9 토큰의 속도로 구동할 수 있다. 또한, 8GB VRAM을 탑재한 약 1,000달러 가격의 RTX 4060 노트북에서도 Qwen3.6-35B 모델을 초당 39.3 토큰으로 실행 가능하다. FreeToken은 기존 Ollama 대비 소비자용 GPU 환경에서 2~4배 더 빠른 추론 속도를 제공한다. 이번 성과는 Andy Shuo Yang 연구원 등이 주도했으며, 로컬 AI 환경의 실용성을 한층 높였다는 평가를 받고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @Yuchenj_UW: UC Berkeley open-sourced FreeToken. Wild results: A single RTX PRO 6000 runs the 753B GLM-5.2 at 14.9 tok/s! An 8GB RTX 4060 lapto
원문 보기 ↗