참고Reddit
의료 AI 분야, 결정론적 디코딩(Greedy Decoding)의 맹점 지적
벤치마크 점수 최적화를 위해 Greedy 방식을 고집할 때 발생하는 편향 및 데이터 왜곡 문제를 경고함.
요약
최근 Reddit의 Machine Learning 게시판에서 언어 모델 추론 시 기본값으로 사용되는 greedy decoding에 대한 주의가 제기되었습니다. MICCAI 학회에 채택된 논문에 따르면, greedy나 beam search 같은 결정론적 디코딩 방식은 반복적이고 일반적인 문구를 생성해 벤치마크 점수를 인위적으로 높이는 경향이 있습니다. 이는 특히 의료 AI 분야에서 위험한 결과를 초래할 수 있어 지양해야 합니다. 단순히 temperature 값을 조정하는 확률적 샘플링 방식은 어휘 다양성을 확보할 수는 있으나, 인구 통계학적 편향을 환각(hallucination)하는 새로운 문제를 발생시킵니다. 따라서 AI 모델의 정확도, 다양성, 공정성 사이에서 최적의 디코딩 전략을 균형 있게 고려하는 접근이 필요합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Stop defaulting to greedy, deterministic decoding! [D][R]
원문 보기 ↗