스펙 기반 개발 보조 툴 'SpecJudge' v0.2.0 업데이트
평가 데이터의 근거를 명확히 제시하도록 개선. 신뢰성 높은 평가 자동화 워크플로우 구축에 유용함.
요약
MIT 라이선스 기반의 CLI 도구인 SpecJudge가 v0.2.0으로 업데이트되며 평가 신뢰성을 강화했다. 기존 버전은 모델의 평가와 함께 서술적인 설명만을 제공했으나, 이는 AI가 사실 여부와 관계없이 유창하게 거짓을 말할 위험이 있었다. 이번 업데이트의 핵심은 평가의 각 차원에 대해 프로젝트 사양 내 실제 근거 문구를 반드시 인용하도록 강제하는 것이다. SpecJudge는 인용된 문구가 원문에 실제로 존재하는지 결정론적으로 검증하며, 만약 근거 없는 인용이 발견될 경우 해당 평가 전체를 무효 처리한다. 이 과정에서 8B 이하 모델들의 평가 로직이 깨지는 버그가 발견되어 수정되었으며, 결과적으로 개발자는 더 정교한 모델 적합성 평가를 받을 수 있게 되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 SpecJudge v0.2.0: the judge now has to cite evidence that actually exists — and a bug that broke every 8B model until it did
원문 보기 ↗