참고X
Qwen 3.8-27B, Groq에서 526 tok/s 기록…고속 추론 성능 확인
오픈 웨이트 모델의 실측 추론 성능 데이터. 인프라 최적화 및 모델 선정 시 참고할 만한 벤치마크 지표.
요약
최근 한 사용자가 테스트한 결과, Groq 플랫폼에서 구동되는 Qwen 3.8-27B 모델이 526 tok/s의 매우 빠른 속도를 기록했다. 해당 테스트의 지연 시간은 74ms로 측정되어 탁월한 처리 성능을 입증했다. 현재 Groq은 이러한 고성능 서비스를 무료로 제공하고 있어 사용자들의 주목을 받고 있다. 다만, 고비용이 발생하는 추론 인프라 특성상 이러한 무료 정책이 언제까지 지속될지에 대해서는 의문이 제기되고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @hqmank: Just tested it myself. Yeah, it's fast. Like, really fast. Qwen 3.8-27B hit 526 tok/s with 74 ms latency for me. I wonder how long
원문 보기 ↗