Jev vs Kev 오픈소스 분류 모델 성능 비교 분석
두 모델의 실무 성능 차이를 검증. 비용과 정확도 사이의 균형이 필요한 에이전트 개발 시 참고할 만한 벤치마크.
요약
Reddit의 r/LocalLLaMA 커뮤니티에서 Apache-2.0 기반으로 파인튜닝된 Kev 4B(Qwen3.5-4B 기반)와 Jev 모델을 362개의 최신 데이터셋으로 비교 분석했다. 성능 비교 결과, 두 모델의 정확도는 모든 작업에서 2% 포인트 이내의 미세한 차이를 보이며 오차 범위 내에 머물렀다. 다만, 문장 패러프레이징 감지(PAWS) 항목에서는 Jev가 87.0%를 기록하며 Kev 4B의 74.5%보다 앞서는 모습을 보였다. 비용 측면에서는 두 모델의 리스트 가격은 동일하나, Jev가 요청당 약 257개의 고정 입력 토큰을 추가로 계상하여 짧은 요청 시 최대 12배 더 비싼 비용이 발생한다. 벤치마크 코드와 전체 테스트 항목은 Opper 측의 GitHub를 통해 공개되어 있으며, 사용자가 직접 테스트를 수행할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Jev vs. Kev: open-source Jev alternative tested side by side
원문 보기 ↗