← promppy_ 실시간 AI 뉴스
참고X

BullshitBench 벤치마크 평가 방식 개선 고민 공유

LLM 벤치마크 시 평가자(심사위원) 모델 선택의 기준과 연속성 유지 사이의 실무적 고민.

요약

X 사용자 @petergostev가 자체 벤치마크인 'BullshitBench'를 통해 GPT-6-Astra 모델을 평가한 결과, 이전 OpenAI 모델들보다 우수한 성능을 보였으나 Anthropic 모델에는 미치지 못했다고 밝혔다. 현재 평가는 Sonnet 4.6, GPT-5.2, Gemini 3.1 Pro 등 구형 모델을 심사위원으로 사용하고 있어 결과의 정확성에 한계가 있다. 작성자는 Fable이나 Astra급의 최신 모델로 재평가를 원하지만, 약 3,000달러의 비용이 소요되는 재평가 실행 여부를 두고 고민 중이다. 또한 심사 모델을 교체할 경우 데이터 연속성이 깨질 위험이 있어 섣불리 결정하지 못하고 있다. 구형 모델을 심사위원으로 사용하면 Astra 모델의 등급이 'Amber(모호함)'로 나오는 경우가 많아, 최신 모델로 재평가할 경우 등급이 'Green'이나 'Red'로 바뀔 가능성이 높다는 지적이다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @petergostev: BullshitBench: GPT-6-Astra did quite a bit better than any previous OpenAI models but not quite reaching Anthropic models yet. BTW

원문 보기 ↗

광고

다음 뉴스 →

중요알트먼, 최첨단 AI 개발 속도 조절 검토…"경쟁 연구소 동참 유도"

안전성 명분의 자율 규제 시도. 프론티어 모델 출시 속도 둔화 가능성, 개발 로드맵 재검토 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스