AI 에이전트 평가 방식의 함정: '완벽한 프롬프트' 대신 사용자 인터랙션 고려해야
에이전트 평가는 가이드가 없는 환경을 시뮬레이션해야 실제 성능을 검증할 수 있습니다. 평가 프레임워크 개선 시 필수 고려 사항.
요약
최근 r/LLMDevs에서는 완벽한 프롬프트를 제공하는 기존 LLM 평가 방식의 비현실성을 지적하며, 정보가 제한된 '시뮬레이션 사용자'를 도입한 실험 결과가 공유되었습니다. 5개 작업에 대해 실험한 결과, 모든 정보를 제공받은 에이전트는 100% 성공했으나, 질문에 답할 때만 정보를 제공하는 시뮬레이션 사용자 환경에서는 성공률이 60%로 하락했습니다. 특히 에이전트가 요구사항을 명확히 확인하지 않아 잘못된 결과물을 생성하는 사례가 다수 발생했습니다. 에스컬레이션 작업에서는 두 방식 모두 100% 성공했으나, 시뮬레이션 사용자 환경에서 비용은 106%, 처리 시간은 199% 증가하는 비효율이 확인되었습니다. 단순 프롬프트 평가로는 이러한 실패와 비용 증가 문제를 발견할 수 없으므로, 에이전트 개발 시 정보를 유보하거나 대화형 모드를 사용하는 사용자 환경을 반영한 평가 방식 도입이 필요합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Same agent task, two users: one gives every detail up front, one only answers when asked. Success went down from 100% to 60%
원문 보기 ↗