참고팁Reddit
AMD MI100 서버용 vLLM 포크 공개: 27B 모델에서 1000 tok/s 달성
AMD 가속기 환경에서 LLM 추론 성능 최적화가 필요한 엔지니어를 위한 튜닝 레퍼런스.
요약
AMD MI100 GPU 4대로 구성된 서버에서 27B 모델 기준 1,000 tok/s 이상의 디코딩 속도를 구현한 사례가 공개되었다. 원작자는 기본 vLLM에서 15 tok/s에 불과했던 성능을 자체 최적화 포크를 통해 디코딩 1,000 tok/s, 프리필 5,000 tok/s(8 동시성 기준)까지 비약적으로 끌어올렸다. 이번 성과는 새로운 커널 작성과 아키텍처 최적화 기법을 대거 적용한 결과이며, 특히 추가된 기능의 절반은 다른 int8 기반 아키텍처에도 유용한 것으로 평가된다. 현재 해당 포크 버전은 2x MI210 서버 환경에서도 1,000 tok/s 이상의 성능을 기록한 것으로 보고되었다. 관련 업계는 MI100과 같은 구형 GPU 환경에서도 커스텀 최적화를 통해 고성능 추론이 가능함을 보여준 사례로 주목하고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Over 1000 tok/s decode for 27B on my 4x MI100 server
원문 보기 ↗