버클리대, 로컬 추론 가속 오픈소스 'FreeToken' 공개
RTX 4060에서 35B 모델 39t/s 구동 가능. 로컬 LLM 환경 구축 및 API 비용 절감 시 활용 검토.
요약
UC Berkeley가 오픈소스로 공개한 'FreeToken'을 통해 고가의 API 비용 없이 개인용 게이밍 노트북에서 거대 AI 모델을 구동할 수 있게 되었다. RTX 4060 노트북에서 350억 파라미터 모델이 초당 39 토큰 속도로 작동하며, RTX 5090 데스크톱에서는 2,840억 파라미터의 DeepSeek V4-Flash 모델을 초당 22 토큰으로 구동 가능하다. 이는 기존 Ollama 대비 3~4배 빠른 성능이며, 프리필(prefill) 속도는 최대 30배까지 향상되었다. 별도의 모델 변환 과정 없이 원클릭 설치만으로 즉시 사용 가능하며, 모든 데이터가 로컬 환경에 저장되어 보안성이 높다. Claude Code나 Codex 등 다양한 코딩 에이전트와 연동할 수 있어, 클라우드 없이도 개인 기기에서 고성능 AI 모델을 실무에 바로 활용할 수 있는 환경이 마련되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @VaibhavSisinty: Your gaming laptop can now run the same AI models that cost companies thousands in API fees. For $0. UC Berkeley open-sourced some
원문 보기 ↗