주요 5개 Frontier 모델 간 팩트체크 결과 23% 불일치 발견
모델마다 사실 판단 기준과 자신감이 다름을 인지하고, RAG 및 검증 파이프라인 구축 시 멀티 모델 교차 검증 설계 필요.
요약
Lenz는 최신 사용자 제보 기반의 1,000개 사실 확인 요청을 Claude Fable 5, GPT-5.6, Gemini 3.1 Pro, Sonar Deep Research, Grok 4.5 등 5개 모델에 동일하게 입력하여 검증 성능을 비교했다. 실험 결과 5개 모델이 모두 동일한 결론에 도달한 경우는 37%에 불과했다. 특히 23%의 사례에서는 모델 간 답변이 5단계 척도에서 2단계 이상 차이 나는 심각한 의견 불일치를 보였다. 더욱 우려되는 점은 이러한 불일치가 발생한 사례의 경우에도 모델들은 평균 9/10 수준의 높은 확신도(confidence)를 보였다는 것이다. 모든 데이터와 소스 코드는 오픈 소스로 공개되어 있으며, 이를 통해 상세한 비교 분석이 가능하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 We gave the same 1,000 fact-check claims to Fable, GPT-5.6, Gemini, Sonar and Grok. On 23% they materially disagreed, usually at 9/10 confidence.
원문 보기 ↗