LingBot-World 2.0 모델, RTX 5090에서 16 FPS 실시간 구동 최적화 사례
커스텀 커널과 SageAttention 활용으로 추론 성능을 2.5배 향상. 로컬 모델 최적화에 참고할 만한 아키텍처 개선 사례.
요약
한 Reddit 사용자가 LingBot-World 2.0 1.3B 모델을 RTX 5090에서 실시간 16 FPS로 구동하는 최적화 코드를 오픈소스로 공개했다. 이는 기존 SGLang Diffusion 대비 2.5배, NVIDIA FlashDreams 대비 1.9배 빠른 속도이다. 작성자는 모델 연산의 수치 정밀도를 낮추면서도 성능 손실 없는 방식을 적용하고, FlashAttention 대신 SageAttention을 도입하며 커스텀 커널을 작성해 이 결과를 도출했다. 현재 해당 모델은 832×464 해상도에서 구동 가능하며, 사용자는 이미지와 프롬프트를 업로드해 예측을 시작할 수 있다. 기존의 추론 엔진들이 동일 하드웨어에서 6~8 FPS에 머물렀던 것과 비교하면 실질적인 성능 향상을 이뤄냈다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I made LingBot-World 2.0 1.3B run at real-time 16 FPS on one RTX 5090. 2.5x faster than SGlang, 1.9x faster than Nvidia
원문 보기 ↗