참고팁Reddit
모델 벤치마크 점수보단 실제 업무 생산성 측정으로 전략 변경
벤치마크는 실제 도메인 성능을 보장하지 않음. 서비스 도입 시 리트라이율과 비용을 포함한 실제 배치 작업 지표로 의사결정할 것.
요약
B2B 서비스에서 LLM 통합을 담당하는 개발자가 새로운 모델이 출시될 때마다 모델 목록을 즉시 업데이트하던 방식에서 벗어나기로 결정했다. 공개된 벤치마크 점수나 토큰 단가만으로는 실제 운영 환경에서의 업무 적합성을 판단하기 어렵고, 재시도 비용 등 숨겨진 비용이 반영되지 않기 때문이다. 대신 기존 모델을 유지하면서 후보군 모델들에 동일한 문서와 고객 응대 태스크를 수행시켜 결과를 비교하는 방식을 도입했다. 이를 통해 수락된 초안의 비율, 재시도 횟수, 지연 시간(latency), 전체 배치 비용을 직접 측정한다. 단순한 토큰 가격 저렴함보다는 실제 운영 환경에서의 성과를 기반으로 모델을 선택하는 것이 실무적으로 더 유용하다는 결론이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I stopped updating our model shortlist on release day
원문 보기 ↗