← promppy_ 실시간 AI 뉴스
참고팁Reddit

[신규툴] 로컬 추론 엔진 'Basalt' 공개: Blackwell GPU 최적화로 성능 2.6배 향상

Blackwell 아키텍처 GPU에서 Qwen3.8(큐원 3.8) Flash-Next 구동 시 토큰 처리 속도를 대폭 높인 로컬 LLM 추론 엔진.

요약

최근 공개된 추론 엔진 'Basalt'는 기존 Strata 대비 최대 2.6배 높은 처리량을 제공하는 Qwen3.8 Flash-Next 및 Blackwell 아키텍처 전용 엔진이다. RTX 5090과 5060 Ti를 조합한 환경에서 테스트한 결과, 구조화된 텍스트 기준 초당 665토큰, 산문 기준 초당 354토큰의 속도를 기록했다. RTX 5090 단일 GPU 환경에서도 초당 585토큰의 속도를 내며, 5060 Ti 추가 시 약 12%의 성능 향상을 보인다. 또한 Basalt는 최대 8명의 사용자를 위한 실시간 동시성을 지원하며, 공유 KV 캐시 및 MTP(Multi-Token Prediction) 기능을 활성화했을 때 8개 스트림에서 총 623토큰/초의 성능을 발휘한다. 이번 결과는 64k 컨텍스트 길이와 IQ3_XXS 양자화 설정을 기준으로 측정되었다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Basalt: Flash-Next at 665 tok/s structured, 354 prose on a 5090 + 5060 Ti (2.6x Strata)

원문 보기 ↗

광고

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스