← promppy_ 실시간 AI 뉴스
참고HF Papers

연구: 'ABSeeker', 답변 역추적 기반 크레딧 할당으로 긴 호흡의 검색 에이전트 성능 향상

검색 에이전트 학습 시 단계별 보상을 정교화하는 기법 제안. RAG 및 검색 에이전트 최적화 관심 시 참고.

요약

장기 탐색 에이전트 학습을 위한 새로운 프레임워크인 ABSeeker와 이를 위한 Answer-Backtracked Credit Assignment(ABC) 기법이 발표되었습니다. 기존 방식은 탐색 과정의 모든 단계를 동일하게 처리했으나, ABC는 정답에서 역추적하여 필요한 단서를 복구하고 각 탐색 단계를 평가하는 세밀한 기법을 통해 유용한 행동에는 보상을 주고 오류나 중복된 행동은 억제합니다. 이 프레임워크를 적용해 Qwen3.5-4B 모델 기반으로 8.5k개의 예제만 학습시킨 ABSeeker는 BrowseComp에서 37.3%, BrowseComp-ZH에서 39.1%의 성능을 기록했습니다. 문맥 관리 기능을 추가할 경우 성능은 각각 55.3%와 52.9%까지 상승하며, 동급 규모(4B) 모델을 크게 앞지르고 약 30B 규모의 모델과 대등한 수준을 보였습니다. 이번 연구는 장기 탐색 에이전트 학습에 있어 정답 기반 역추적 단계별 신용 할당 방식이 매우 효과적임을 입증했습니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

원문 보기 ↗
다음 뉴스 →

중요OpenAI-Hugging Face 보안 사고, Black Hat 발표로 상세 타임라인 공개

실제 사고 대응 과정과 교훈 정리. AI 공급망·연동 보안 점검 시 참고 가치 있음.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스