모델/프롬프트 평가 자동화 도구 'smevals' 공개
다양한 모델 설정에 대해 로컬에서 간편하게 평가 스위트를 구축하고 결과를 비교할 수 있는 실용적인 평가 프레임워크입니다.
요약
Simon Willison과 Prime Radiant가 협력하여 LLM 모델, 프롬프트, 하네스를 평가하기 위한 새로운 도구인 smevals를 공개했다. 사용자는 YAML 파일로 평가 스위트(eval suite)를 정의한 뒤, `uvx smevals run` 명령어를 통해 여러 모델 구성에 대해 평가를 실행할 수 있다. 평가는 실행(run)과 채점(grade) 과정이 분리되어 진행되며, `smevals grade`를 통해 사전에 설정한 기준에 따라 결과를 채점한다. 결과 확인은 `smevals serve`로 로컬 서버를 띄우거나 `smevals build` 명령어를 사용하여 정적 HTML 보고서로 생성할 수 있다. 이 도구는 코딩 에이전트가 `uvx smevals docs` 명령을 통해 사용법을 학습할 수 있도록 설계되어, 평가 체계 구축 과정을 효율화했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 smevals - a small eval suite for evaluating models, prompts, and harnesses
원문 보기 ↗