참고팁Reddit
RTX 5090 기반 로컬 LLM 벤치마크: Bonsai 2 27B vs Gemma/Qwen
Bonsai 2 모델의 로컬 추론 성능 및 자원 효율성 확인. 대규모 로컬 모델 구동 시 성능 지표로 참고 가능.
요약
PrismML이 Qwen 3.8 27B 모델을 대폭 양자화한 신규 모델 'Bonsai 2 27B'를 공개했다. 이 모델은 FP16 대비 98% 이상의 성능을 유지하면서 Q1 양자화 시 약 6GB, Q2 양자화 시 약 8GB의 메모리만 차지하는 경량화 효율을 보여준다. RTX 5090 환경에서 진행된 벤치마크 테스트에서 Bonsai 2 27B는 Gemma 4 12B 및 Qwen 3.5 9B와 비교되었다. 테스트 결과, Bonsai 2 27B는 토큰 사용량의 90%를 사고 과정에 할당하는 등 다른 모델 대비 높은 자율성을 입증했다. 이번 테스트는 PrismML llama.cpp 포크와 CUDA 12.8 빌드 환경에서 수행되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 RTX 5090 Bonsai 2 27B vs Gemma 4 12B vs Qwen 3.5 9B Japanese voxel pagoda
원문 보기 ↗