← promppy_ 실시간 AI 뉴스
참고Reddit

4GB VRAM에서 70B 모델 구동: 로컬 LLM 엔진 'NEW BRAIN' 공개

VRAM 부족 환경에서 로컬 장비를 메쉬로 묶어 대규모 모델을 실행하는 저사양 최적화 솔루션.

요약

NEW BRAIN은 고사양 GPU 없이도 로컬에서 70B 이상의 대규모 언어 모델을 구동할 수 있도록 설계된 새로운 멀티모달 엔진이다. 이 엔진은 레이어 가중치를 디스크나 RAM에서 GPU VRAM으로 반복적으로 스트리밍하는 방식을 사용하여 4GB VRAM 환경에서도 CUDA OOM 오류 없이 모델을 실행한다. 특히 로컬 Wi-Fi를 통해 여러 기기를 연결하여 VRAM을 통합하는 P2P 텐서 메시 샤딩 기능을 제공한다. DeepSeek R1, Llama 3.3, Qwen 2.5, Phi-4 등 80개 이상의 주요 모델을 지원하며 자동 양자화 및 자동 장애 조치 기능이 포함되어 있다. 고가의 하드웨어 없이도 강력한 AI 모델을 활용하려는 개발자들에게 실용적인 대안이 될 것으로 보인다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 I built NEW BRAIN - An engine that streams 70B+ LLMs on 4GB VRAM GPUs & shards tensors over local Wi-Fi

원문 보기 ↗
다음 뉴스 →

중요엔비디아·MS·메타 등 25개 기업, 오픈 웨이트 모델 과잉 규제에 경고

오픈 웨이트 모델 규제 논의가 본격화. Llama 등 오픈 모델 기반 서비스라면 정책 리스크 주시 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스