참고팁Reddit
로컬 LLM 벤치마킹 도구 'smokebench' 오픈소스 공개
로컬 환경에서 모델별 TPS, TTFT를 정량적으로 비교하고 회귀를 빠르게 테스트할 수 있는 TUI 도구.
요약
최근 LLM 개발 커뮤니티에서 로컬 환경의 모델 성능을 간편하게 테스트할 수 있는 오픈소스 TUI 도구 'smokebench'가 공개되었다. 기존 공개 리더보드와 달리, 사용자는 직접 퀀타이즈하거나 파인튜닝한 모델을 자신의 환경에서 실시간으로 벤치마킹할 수 있다. 수학, 코드, 창의적 글쓰기, 긴 컨텍스트 등 8개 카테고리에 대해 LLM-as-judge 방식의 점수 평가와 TTFT, TPS 지표를 제공한다. OpenAI 및 Anthropic 호환 엔드포인트를 지원하며, Ollama, LM Studio, vLLM 등과 즉시 연동 가능하다. 테스트 결과는 마크다운이나 JSON 형식의 로그로 내보낼 수 있어 모델 간 성능 비교와 회귀 분석에 유용하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I made smokebench - a lightweight TUI for quick LLM benchmarking (smoke-testing)
원문 보기 ↗