← promppy_ 실시간 AI 뉴스
참고X

버클리대, 로컬 추론 가속 오픈소스 'FreeToken' 공개

RTX 4060에서 35B 모델 39t/s 구동 가능. 로컬 LLM 환경 구축 및 API 비용 절감 시 활용 검토.

요약

UC Berkeley가 오픈소스로 공개한 'FreeToken'을 통해 고가의 API 비용 없이 개인용 게이밍 노트북에서 거대 AI 모델을 구동할 수 있게 되었다. RTX 4060 노트북에서 350억 파라미터 모델이 초당 39 토큰 속도로 작동하며, RTX 5090 데스크톱에서는 2,840억 파라미터의 DeepSeek V4-Flash 모델을 초당 22 토큰으로 구동 가능하다. 이는 기존 Ollama 대비 3~4배 빠른 성능이며, 프리필(prefill) 속도는 최대 30배까지 향상되었다. 별도의 모델 변환 과정 없이 원클릭 설치만으로 즉시 사용 가능하며, 모든 데이터가 로컬 환경에 저장되어 보안성이 높다. Claude Code나 Codex 등 다양한 코딩 에이전트와 연동할 수 있어, 클라우드 없이도 개인 기기에서 고성능 AI 모델을 실무에 바로 활용할 수 있는 환경이 마련되었다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @VaibhavSisinty: Your gaming laptop can now run the same AI models that cost companies thousands in API fees. For $0. UC Berkeley open-sourced some

원문 보기 ↗
다음 뉴스 →

중요정체불명 스텔스 모델 'Ox Alpha' 등장, 개발 주체 두고 중국설 확산

OpenRouter 무료 공개된 코딩·에이전트 특화 모델. 출처 불명이라 프로덕션 도입 전 신뢰성 검증 필수.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스