프롬프트 인젝션 방어 솔루션 'Prompt Guard 2' 벤치마크 분석
에이전트 보안 구축 시 기존 방어 도구의 실효성을 검증한 데이터. 방어 아키텍처 수립에 참고.
요약
최근 Reddit의 한 사용자가 LLM 에이전트의 프롬프트 인젝션 방어를 위한 '방화벽' 성능을 검증하는 벤치마크 결과를 공유했다. ETH Zurich의 AgentDojo 데이터셋 내 629개의 공격 케이스와 97개의 정상 케이스를 사용하여 Meta의 Prompt Guard 2(86M 모델)와 단순 정규표현식(regex) 기반 탐지 성능을 비교했다. 실험 결과, 정규표현식은 0개, Prompt Guard 2는 629개 중 6개만을 탐지해내며 매우 낮은 공격 차단율을 보였다. 특히 정상 도구 출력물에 공격을 포함시킨 환경에서는 두 방식 모두 사실상 인젝션 공격을 걸러내지 못했다. 다만 두 방식 모두 97개의 정상 케이스에서는 오탐지(False Positive)가 발생하지 않았다는 점은 확인되었다. 이번 분석은 에이전트 환경에서 도구 출력을 통한 인젝션 공격 방어가 기존 모델만으로는 쉽지 않음을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Prompt Guard 2 flags 0 of 27 AgentDojo injection payloads even in isolation: benchmark + analysis
원문 보기 ↗