도어대시의 AI 어시스턴트 평가 파이프라인: 시뮬레이션 기반 자동 채점 체계 구축
실무 환경에서 LLM 평가를 자동화하고 서비스 품질을 개선하는 구체적인 엔지니어링 방법론 제공.
요약
DoorDash는 자사 앱 내 AI 어시스턴트인 Ask DoorDash의 성능 평가를 자동화하는 시스템을 구축했습니다. 초기에는 직원들이 수동으로 피드백을 작성하여 테스트에 6시간 이상이 소요되는 등 품질 검증에 어려움을 겪었습니다. DoorDash는 이를 해결하기 위해 명시적인 평가 기준을 수립하고 실제 로그를 기반으로 시뮬레이션 환경을 구축하여 재현성을 확보했습니다. 특히 LLM을 활용해 사람의 평가를 보정하고 자동으로 점수를 매기는 방식을 도입했습니다. 그 결과 일일 평가 세션은 2,000건으로 늘어났고 테스트 시간은 20분으로 단축되었으며, 전국 서비스 출시 전 오류율을 절반 가까이 낮췄습니다. 이는 향후 AI 모델을 도입하는 모든 기업에 '평가 엔지니어'와 같은 정교한 검증 프로세스가 필수적임을 시사합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @undefinedKi: DoorDash just published the full structure behind Ask DoorDash, their new AI assistant. And it's the clearest picture of the AI jo
원문 보기 ↗