참고Reddit
371개 모델 대상 벤치마크 결과 통합 제공 사이트 공개
다양한 LLM의 응답 데이터를 한곳에서 비교하고 검증할 수 있는 유용한 리소스.
요약
Reddit의 r/LocalLLaMA 커뮤니티에서 2024년 5월부터 371개의 AI 모델을 동일한 프롬프트로 테스트한 결과물을 모은 'museumofmodels.com'이 공개되었습니다. 이 프로젝트는 시스템 프롬프트 없이 온도값(Temperature) 0.7을 설정한 후 각 모델당 단 한 번의 답변을 도출하여 데이터베이스화했습니다. 여기에는 다양한 오픈 웨이트 모델은 물론, 현재는 실행이 불가능해진 93개의 모델까지 포함되어 있습니다. 별도의 회원가입 없이 누구나 무료로 모델별 답변을 직접 비교할 수 있어 AI 모델의 성능 변화를 추적하는 실무자에게 유용한 자료가 될 전망입니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Same prompts to 371 models since May 2024, all the answers in one place
원문 보기 ↗