참고Reddit
AI 생성 텍스트의 'AI 느낌(Slop)' 측정 벤치마크 공개
18개 모델의 문체와 표현력을 정량적으로 평가하여 상투적인 AI 말투를 거르는 도구.
요약
최근 레딧에서 AI 모델이 생성한 텍스트가 얼마나 'AI스러운' 문체인지 측정하는 오픈소스 벤치마크인 'theslopindex.com'이 공개되었다. 해당 벤치마크는 이메일, 슬랙, 소셜 미디어, 에세이 등 4개 영역의 인간 작성 데이터를 기준점으로 삼아 모델의 결과물과 비교하는 방식을 취한다. 제작자는 총 112개의 다양한 작성 시나리오를 18개 AI 모델에 동일한 기본 설정으로 입력해 성능을 평가했다. 이 실험은 'throat-clearing opener'나 'rule of three' 같은 전형적인 AI 문체(slop)를 통계적으로 수치화하여 어떤 모델이 가장 인간다운 글을 쓰는지 가려내기 위해 설계되었다. AI를 실무에 활용하는 사용자들에게 어떤 모델이 기계적인 어투를 덜 사용하는지 판단할 수 있는 유의미한 지표를 제공할 것으로 기대된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I benchmarked which of 18 AI models writes the least like "AI slop"
원문 보기 ↗