LLM 반증 검출 모델의 벤치마크 신뢰성 분석
데이터 파이프라인 설계 시 벤치마크 데이터의 불완전성과 파싱 오류 주의.
요약
최근 Reddit의 LLMDevs 커뮤니티에서는 LLM의 보수성 설정이 오히려 성능에 악영향을 미친다는 분석 결과가 공유되었습니다. 사용자는 모순 탐지 모델이 스스로 판단할 수 없을 때 이를 거부하도록 설정했으나, 실제 모델의 거부율은 40%p 상승했고 답변의 정확도마저 떨어지는 현상이 발생했습니다. 연구는 생의학적 모순 탐지 벤치마크인 ManConCorpus를 활용해 24개의 체계적 문헌 고찰과 259개의 전문가 주석이 달린 728개 쌍의 데이터를 검토하며 진행되었습니다. 분석 결과, 전체 데이터의 77.1%가 PICO(환자·중재·비교·결과) 정보 중 일부를 누락하고 있었으며, 특히 55.9%의 쌍에서 환자군 정보가 결여된 것으로 나타났습니다. 결과적으로 모델에게 보수적인 태도를 지시하는 것보다 입력 데이터의 품질과 맥락을 보완하는 것이 모순 탐지 성능 향상에 더욱 중요한 것으로 확인되었습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I told the model to be conservative. Refusals went up 40 points and the direction got worse.
원문 보기 ↗