참고팁Reddit
로컬 LLM 벤치마크 단축: 'Terminal-Bench Mini' 데이터셋 공개
전체 벤치마크 대비 14개 인스턴스로 대표 순위를 산출 가능. 로컬 모델 평가 시간 절약에 유용.
요약
최근 Reddit의 r/LLMDevs 커뮤니티에 로컬 LLM의 벤치마크 효율성을 높이기 위한 Terminal Bench Mini가 공개되었습니다. 기존 agentic 벤치마크는 실행 시간이 오래 걸리는 문제가 있었으나, 이번에 발표된 Terminal Bench Mini는 전체 terminal-bench 데이터셋 중 14개 인스턴스만을 추출하여 이를 해결했습니다. 해당 서브셋은 전체 리더보드와 대표성 있는 순위를 재현할 수 있어 평가 속도를 크게 단축할 수 있습니다. 관련 데이터셋은 Hugging Face(https://huggingface.co/datasets/LocalLLaMA/terminal-bench-mini)를 통해 이용 가능합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Terminal Bench Mini a 14 instance subset of terminal-bench that replicates the rankings of the leaderboard
원문 보기 ↗