추론 속도 2,086 t/s 기록, 신규 모델 'Celeris-1' 벤치마크 화제
상용 GPU에서 극단적인 추론 속도를 구현한 모델. 고속 추론이 필요한 서비스 설계 시 성능 지표로 참고할 것.
요약
Artificial Analysis의 최신 평가에서 Celeris-1이 출력 속도 부문 1위를 차지하며 초당 약 2,086 토큰을 기록했다. 이 모델은 전용 추론 칩셋 없이 상용 GPU 환경에서 이와 같은 성능을 구현했다고 밝혔다. MMLU-Pro 벤치마크 결과, Celeris-1은 75.9%의 점수를 달성하며 GPT-4o mini(78.5%) 및 GPT-4o(81.9%)와 견줄 만한 성능을 보였다. 특히 기존 모델 대비 13~16배 빠른 응답 속도를 제공한다는 점이 강점이다. 고속 추론 효율성을 입증한 Celeris-1의 성과는 실무 환경에서의 모델 선택지에 새로운 대안이 될 것으로 평가된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @kimmonismus: Crazy: Artificial Analysis currently ranks Celeris-1 #1 for output speed at roughly 2,086 tokens per second @ 75.9% on MMLU-Pro! C
원문 보기 ↗