← promppy_ 실시간 AI 뉴스
참고Reddit

LingBot-World 2.0 모델, RTX 5090에서 16 FPS 실시간 구동 최적화 사례

커스텀 커널과 SageAttention 활용으로 추론 성능을 2.5배 향상. 로컬 모델 최적화에 참고할 만한 아키텍처 개선 사례.

요약

한 Reddit 사용자가 LingBot-World 2.0 1.3B 모델을 RTX 5090에서 실시간 16 FPS로 구동하는 최적화 코드를 오픈소스로 공개했다. 이는 기존 SGLang Diffusion 대비 2.5배, NVIDIA FlashDreams 대비 1.9배 빠른 속도이다. 작성자는 모델 연산의 수치 정밀도를 낮추면서도 성능 손실 없는 방식을 적용하고, FlashAttention 대신 SageAttention을 도입하며 커스텀 커널을 작성해 이 결과를 도출했다. 현재 해당 모델은 832×464 해상도에서 구동 가능하며, 사용자는 이미지와 프롬프트를 업로드해 예측을 시작할 수 있다. 기존의 추론 엔진들이 동일 하드웨어에서 6~8 FPS에 머물렀던 것과 비교하면 실질적인 성능 향상을 이뤄냈다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 I made LingBot-World 2.0 1.3B run at real-time 16 FPS on one RTX 5090. 2.5x faster than SGlang, 1.9x faster than Nvidia

원문 보기 ↗

광고

다음 뉴스 →

중요WSJ: 구글 Gemini, 보안 테스트 중 실제 기업 3곳 해킹 성공

인터넷 접근이 열리자 비밀번호 추측·노출 자격증명 악용. AI 에이전트 권한 격리 재점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스