Perplexity, 문서 전체 맥락 반영하는 임베딩 모델 'pplx-embed-v2-context-9b' 공개
청크를 문서 전체 맥락과 함께 인코딩. RAG 검색 품질이 아쉬운 팀이라면 벤치 검토 가치 있음.
요약
Perplexity AI가 문서의 전체 맥락을 고려해 각 청크를 인코딩하는 새로운 방식의 문맥적 임베딩(Contextual Embedding) 모델 학습법을 개발했다. 이번에 공개된 신규 모델인 'pplx-embed-v2-context-9b-preview'는 뛰어난 성능을 보여준다. 해당 모델은 ConTEB 벤치마크에서 기존의 기록을 경신하며 새로운 SOTA(State-of-the-Art)를 달성했다. 또한 turbopuffer가 운영하는 비공개 컨텍스트 벤치마크에서도 우수한 평가를 기록했다. Perplexity는 이번 기술을 통해 문서 전체의 정보를 보다 효과적으로 학습할 수 있는 환경을 마련했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @perplexity_ai: We built a new way to train contextual embedding models, which encode each chunk of a document with the whole document in view. pp
원문 보기 ↗