BullshitBench 벤치마크 평가 방식 개선 고민 공유
LLM 벤치마크 시 평가자(심사위원) 모델 선택의 기준과 연속성 유지 사이의 실무적 고민.
요약
X 사용자 @petergostev가 자체 벤치마크인 'BullshitBench'를 통해 GPT-6-Astra 모델을 평가한 결과, 이전 OpenAI 모델들보다 우수한 성능을 보였으나 Anthropic 모델에는 미치지 못했다고 밝혔다. 현재 평가는 Sonnet 4.6, GPT-5.2, Gemini 3.1 Pro 등 구형 모델을 심사위원으로 사용하고 있어 결과의 정확성에 한계가 있다. 작성자는 Fable이나 Astra급의 최신 모델로 재평가를 원하지만, 약 3,000달러의 비용이 소요되는 재평가 실행 여부를 두고 고민 중이다. 또한 심사 모델을 교체할 경우 데이터 연속성이 깨질 위험이 있어 섣불리 결정하지 못하고 있다. 구형 모델을 심사위원으로 사용하면 Astra 모델의 등급이 'Amber(모호함)'로 나오는 경우가 많아, 최신 모델로 재평가할 경우 등급이 'Green'이나 'Red'로 바뀔 가능성이 높다는 지적이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @petergostev: BullshitBench: GPT-6-Astra did quite a bit better than any previous OpenAI models but not quite reaching Anthropic models yet. BTW
원문 보기 ↗