ChatGPT 모델의 자신감 있는 오답(환각) 문제와 프롬프팅 해법
최신 벤치마크 결과 GPT-5.6 모델의 환각 확률 확인. 모델이 모르는 것을 모른다고 답하게 유도하는 프롬프트 최적화 필수.
요약
최근 Artificial Analysis의 AA-Omniscience 벤치마크 결과, OpenAI 모델들은 틀린 답을 제시할 때 자신이 모른다고 답하기보다 자신 있게 추측하는 경향이 88~93%에 달하는 심각한 환각 문제를 보였다. 구체적으로 GPT-5.6 Terra는 88%, Pro는 91%, Sol은 92%, Ultra는 93%의 확률로 자신 있게 잘못된 답변을 내놓는 것으로 확인되었다. 그러나 이러한 환각 문제는 사용자의 프롬프팅 방식에 따라 크게 개선될 수 있다는 점이 핵심이다. 모델이 무리하게 추측하지 않고 모르는 부분을 인정하도록 유도하는 프롬프트 작성이 실무적으로 중요하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @godofprompt: ChatGPT has a serious hallucination problem, and there's now a benchmark that proves it. on Artificial Analysis' AA-Omniscience be
원문 보기 ↗