← promppy_ 실시간 AI 뉴스
참고Reddit

AI 의사결정 모델 성능 벤치마크 공개: 팩맨 게임으로 측정

다양한 의사결정 모델의 지연 시간과 성능을 팩맨 게임으로 비교한 데이터로, 에이전트 모델 선택 시 참고 자료로 활용 가능함.

요약

Reddit의 r/LocalLLaMA 커뮤니티에서 jev 1.13, Kev 4B, Clef, Clef Flash, GPT-6 Luna, Laya 등 6개의 인기 의사결정 모델을 팩맨 게임으로 테스트한 결과를 공개했다. 테스트 결과 jev 1.13이 평균 점수 2,750점으로 가장 높은 성능을 기록했으며, GPT-6 Luna가 2,568점, Clef Flash가 2,538점으로 그 뒤를 이었다. 모델별 평균 지연 시간은 Laya가 104ms로 가장 빨랐으며 GPT-6 Luna 179ms, Kev 4B 231ms 순으로 나타났다. 이번 테스트는 밀리초 단위의 실시간 반응이 필요한 게임 환경에서 각 모델의 의사결정 능력을 검증하기 위해 진행되었다. 관련 저장소는 오픈소스로 공개되어 있어 누구나 직접 튜닝한 모델을 구동하거나 호스팅하여 리더보드에 참여할 수 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 jevman: AI decision models play Pac-Man

원문 보기 ↗

광고

다음 뉴스 →

중요Anthropic(앤트로픽), Claude Sonnet 5.5(클로드 소넷 5.5) 캐시 읽기 가격 절반으로 인하

캐시 읽기 100만 토큰당 $0.10로, 에이전트 작업 비용 약 20% 절감. Claude(클로드) API 쓰면 검토 가치.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스