AI 에이전트 안전성 강화: '행동 결과 예측 모델'의 실효성
에이전트 실행 전 결과 리스크를 평가하는 별도 오라클 모델을 배치해 사고율을 획기적으로 낮춘 사례.
요약
최근 Reddit의 LocalLLM 커뮤니티에서는 AI 에이전트가 단독으로 수행할 때 발생하는 높은 오류율을 해결하기 위해 별도의 '결과 예측 모델(consequence model)'이 필요하다는 분석이 화제입니다. 7개 앱을 대상으로 1,273번의 에이전트 실행을 테스트한 결과, Claude Sonnet 3.5 등을 포함한 에이전트 단독 수행 시 20~57%의 확률로 피해가 발생했습니다. 반면, 각 행동 전 '이 작업을 수행하면 어떤 일이 발생하는가?'를 질문하고 판단하는 '결과 오라클(consequence oracle)'을 도입했을 때, 피해 발생률은 0~3% 수준으로 대폭 감소했습니다. Ekbasis는 이러한 기능을 수행하는 27B 규모의 예측 오라클로, 에이전트가 볼 수 없는 앱 내부 상태를 확인하고 다지선다형 질문에 대해 신뢰도(ECE 0.04~0.07)를 기반으로 답변을 제공합니다. 신뢰도가 0.5 미만일 경우에는 판단을 사용자에게 위임하며, 불확실한 상황을 억지로 단정 짓지 않는 방식으로 안전성을 확보합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 After 1,273 agent runs, I'm convinced: agents need a consequence model beside them, not a better prompt.
원문 보기 ↗