연구: 'ABSeeker', 답변 역추적 기반 크레딧 할당으로 긴 호흡의 검색 에이전트 성능 향상
검색 에이전트 학습 시 단계별 보상을 정교화하는 기법 제안. RAG 및 검색 에이전트 최적화 관심 시 참고.
요약
장기 탐색 에이전트 학습을 위한 새로운 프레임워크인 ABSeeker와 이를 위한 Answer-Backtracked Credit Assignment(ABC) 기법이 발표되었습니다. 기존 방식은 탐색 과정의 모든 단계를 동일하게 처리했으나, ABC는 정답에서 역추적하여 필요한 단서를 복구하고 각 탐색 단계를 평가하는 세밀한 기법을 통해 유용한 행동에는 보상을 주고 오류나 중복된 행동은 억제합니다. 이 프레임워크를 적용해 Qwen3.5-4B 모델 기반으로 8.5k개의 예제만 학습시킨 ABSeeker는 BrowseComp에서 37.3%, BrowseComp-ZH에서 39.1%의 성능을 기록했습니다. 문맥 관리 기능을 추가할 경우 성능은 각각 55.3%와 52.9%까지 상승하며, 동급 규모(4B) 모델을 크게 앞지르고 약 30B 규모의 모델과 대등한 수준을 보였습니다. 이번 연구는 장기 탐색 에이전트 학습에 있어 정답 기반 역추적 단계별 신용 할당 방식이 매우 효과적임을 입증했습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
원문 보기 ↗