← promppy_ 실시간 AI 뉴스
참고X

UC Berkeley, 고속 로컬 추론 라이브러리 'FreeToken' 오픈소스 공개

기존 Ollama 대비 2~4배 빠른 추론 성능 제공. 로컬 LLM 구동 환경 구축 시 생산성 향상 기대.

요약

UC Berkeley Sky Lab에서 로컬 AI 추론을 가속화하는 'FreeToken'을 오픈소스로 공개했다. 이 기술을 활용하면 단일 RTX PRO 6000 GPU에서 753B 파라미터 규모의 GLM-5.2 모델을 초당 14.9 토큰의 속도로 구동할 수 있다. 또한, 8GB VRAM을 탑재한 약 1,000달러 가격의 RTX 4060 노트북에서도 Qwen3.6-35B 모델을 초당 39.3 토큰으로 실행 가능하다. FreeToken은 기존 Ollama 대비 소비자용 GPU 환경에서 2~4배 더 빠른 추론 속도를 제공한다. 이번 성과는 Andy Shuo Yang 연구원 등이 주도했으며, 로컬 AI 환경의 실용성을 한층 높였다는 평가를 받고 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @Yuchenj_UW: UC Berkeley open-sourced FreeToken. Wild results: A single RTX PRO 6000 runs the 753B GLM-5.2 at 14.9 tok/s! An 8GB RTX 4060 lapto

원문 보기 ↗
다음 뉴스 →

중요정부, '미래대응기금' 신설…초과세수로 AI·첨단기술 집중 투자

향후 2~3년 국가 AI 투자 확대 예고. AI R&D·인프라 정부 과제·지원사업 확대 대비 가치.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

다른 매체 보도

관련 뉴스

최신 뉴스