참고팁Reddit
로컬 LLM 'Mirai S' 벤치마크: 12GB VRAM에서 262k 컨텍스트 및 70tok/s 달성
최신 로컬 모델 최적화 패치 공개. 12GB VRAM 환경에서 고성능 추론이 가능한 구체적인 셋업 사례.
요약
최근 공개된 Mirai S 모델이 12GB VRAM 환경에서 262k 컨텍스트와 초당 70토큰(70tok/s)의 추론 속도를 구현하며 로컬 AI 성능의 새로운 기준을 제시했다. 이번 업데이트는 Qwen3.8-27B-S-experimental 모델을 기반으로 하며, professorpalmer의 mirai-s-ada 패치를 통해 에이전트 성능과 추론 속도를 대폭 개선했다. 16GB 이상 VRAM 사용자의 경우 모든 포지션을 VRAM에 로드해 더 높은 효율성을 확보할 수 있다. 특히 품질 개선 패치는 별도의 도구가 없는 채팅 요청에 OpenAI 방식의 run_python 함수 정의를 자동으로 추가하고, WASI 샌드박스 환경에서 코드를 실행하는 기능을 포함한다. 저사양 GPU에서도 고성능 에이전트 AI를 구동할 수 있게 되어 소규모 로컬 환경에서의 활용성이 크게 높아졌다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Mirai S 70 tok/s, 262k context, 12GB GPU
원문 보기 ↗