← promppy_ 실시간 AI 뉴스
참고Reddit

LLM 평가 신뢰도 향상 위한 'JudgeCalibrationKit' 공개

LLM을 저지(judge)로 사용할 때 인간 평가와의 일치도를 검증하고 신뢰 구간을 확인할 수 있는 Swift 패키지.

요약

LLM 평가 과정에서 모델의 판단을 인간의 주석과 비교하여 신뢰성을 검증할 수 있는 Swift 패키지 'JudgeCalibrationKit'이 공개되었다. Apache-2.0 라이선스로 배포된 이 도구는 Cohen’s κ, weighted κ, Krippendorff’s α 등 다양한 통계 지표를 통해 판단의 일치도를 측정한다. 특히 전체 데이터의 평균 일치도만으로는 파악하기 어려운 특정 구간의 성능 저하 문제를 해결하기 위해 '메타데이터 슬라이스(metadata slice)' 기능을 제공한다. 사용자는 로캘 등 특정 슬라이스를 설정하고, 해당 슬라이스 그룹 내에서 최악의 성능을 보이는 구간을 선별적으로 게이트(gate)할 수 있다. 결정론적 클러스터링 부트스트랩 신뢰 구간(CI)을 활용해 평가 데이터의 통계적 유의성을 정밀하게 검증할 수 있는 것이 특징이다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Open-source judge–human calibration with κ, bootstrap CIs, abstentions and worst-slice gates (Swift)

원문 보기 ↗
다음 뉴스 →

중요DeepSeek V4-Flash, 동일 벤치마크 태스크를 Fable 대비 105배 저렴하게 완수

토큰 단가뿐 아니라 태스크당 총비용이 진짜 지표. 에이전트 모델 선정 시 턴 수까지 함께 검증할 것.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스