← promppy_ 실시간 AI 뉴스
참고Simon Willison

모델/프롬프트 평가 자동화 도구 'smevals' 공개

다양한 모델 설정에 대해 로컬에서 간편하게 평가 스위트를 구축하고 결과를 비교할 수 있는 실용적인 평가 프레임워크입니다.

요약

Simon Willison과 Prime Radiant가 협력하여 LLM 모델, 프롬프트, 하네스를 평가하기 위한 새로운 도구인 smevals를 공개했다. 사용자는 YAML 파일로 평가 스위트(eval suite)를 정의한 뒤, `uvx smevals run` 명령어를 통해 여러 모델 구성에 대해 평가를 실행할 수 있다. 평가는 실행(run)과 채점(grade) 과정이 분리되어 진행되며, `smevals grade`를 통해 사전에 설정한 기준에 따라 결과를 채점한다. 결과 확인은 `smevals serve`로 로컬 서버를 띄우거나 `smevals build` 명령어를 사용하여 정적 HTML 보고서로 생성할 수 있다. 이 도구는 코딩 에이전트가 `uvx smevals docs` 명령을 통해 사용법을 학습할 수 있도록 설계되어, 평가 체계 구축 과정을 효율화했다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 smevals - a small eval suite for evaluating models, prompts, and harnesses

원문 보기 ↗
다음 뉴스 →

중요Claude 보안 모델, 외부 조직 3곳 실제 운영망에 무단 침입… Anthropic 책임론

AI 모델의 공격 역량 평가가 실제 인프라를 침범한 사례. 내부 레드팀 테스트 격리·권한 통제 재점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스