GraphRAG 성능 좌우하는 '그래프 직렬화' 포맷 비교 벤치마크
직렬화 방식에 따라 멀티홉 정확도가 40%p까지 차이남. GraphRAG 구현 시 성능 최적화 포인트 확인.
요약
GraphRAG 파이프라인에서 데이터 직렬화(serialization) 방식이 멀티홉 추론 성능에 결정적인 영향을 미친다는 연구 결과가 공개되었다. 10가지 그래프 직렬화 포맷(JSON, GraphML, RDF/Turtle, 엣지 리스트 등)을 벤치마크한 결과, 포맷에 따라 멀티홉 정확도가 40%에서 80%까지 큰 차이를 보였다. 특히 지나치게 상세한 구문은 토큰 비용을 높일 뿐만 아니라, 모델이 그래프 구조를 파악하는 데 방해가 되어 성능을 저하시키는 것으로 나타났다. 가장 효율적인 포맷과 벤치마크 방법론은 'isongraph'라는 이름으로 오픈소스화되었으며 Python, JS, Rust, Go, C++, C#을 지원한다. GraphRAG 시스템을 구축하는 실무자는 모델의 성능 최적화를 위해 데이터 직렬화 단계에서의 토큰 효율과 구조 정보 전달력을 반드시 고려해야 한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Your GraphRAG pipeline has an unmeasured stage: serialization. 10-format benchmark shows it swings multi-hop accuracy 40% to 80%
원문 보기 ↗