AI 의사결정 모델 성능 벤치마크 공개: 팩맨 게임으로 측정
다양한 의사결정 모델의 지연 시간과 성능을 팩맨 게임으로 비교한 데이터로, 에이전트 모델 선택 시 참고 자료로 활용 가능함.
요약
Reddit의 r/LocalLLaMA 커뮤니티에서 jev 1.13, Kev 4B, Clef, Clef Flash, GPT-6 Luna, Laya 등 6개의 인기 의사결정 모델을 팩맨 게임으로 테스트한 결과를 공개했다. 테스트 결과 jev 1.13이 평균 점수 2,750점으로 가장 높은 성능을 기록했으며, GPT-6 Luna가 2,568점, Clef Flash가 2,538점으로 그 뒤를 이었다. 모델별 평균 지연 시간은 Laya가 104ms로 가장 빨랐으며 GPT-6 Luna 179ms, Kev 4B 231ms 순으로 나타났다. 이번 테스트는 밀리초 단위의 실시간 반응이 필요한 게임 환경에서 각 모델의 의사결정 능력을 검증하기 위해 진행되었다. 관련 저장소는 오픈소스로 공개되어 있어 누구나 직접 튜닝한 모델을 구동하거나 호스팅하여 리더보드에 참여할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 jevman: AI decision models play Pac-Man
원문 보기 ↗