← promppy_ 실시간 AI 뉴스
참고Reddit

듀얼 Tesla P100 환경에서 Qwen 3.8 27B(Q6_K) 40+ TPS 성능 기록

구형 서버용 GPU를 활용한 로컬 LLM 추론 최적화 사례. P100 하드웨어를 보유한 개발자라면 참고할 만한 셋업.

요약

한 사용자가 Tesla P100 GPU 2대를 활용해 Qwen 2.5 32B(Q6_K 양자화) 모델에서 초당 40토큰(tps) 이상의 추론 속도를 구현하는 커널 최적화 프로젝트를 공유했다. 이 설정은 각 GPU의 전력을 175W로 제한한 상태에서 PCIe Gen 3 인터페이스를 통해 구동되며, 250W의 최대 전력 사용 시 더 높은 성능 향상이 가능할 것으로 예상된다. 개발자는 이번 최적화 과정에서 속도와 수학적 정확성, 그리고 장시간 구동 시의 속도 유지에 중점을 두었다고 밝혔다. 특히 정확도 검증을 위해 Claude 3 Opus 에이전트들을 3일간 실행하며 오류를 수정하는 과정을 거쳤다. 해당 프로젝트는 전문 학위 없이 AI 모델 최적화에 도전한 사례로, 로컬 LLM 커뮤니티에서 주목받고 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 2x tesla p100, qwen 3.8 27B (q6_k quant) at 40+tps

원문 보기 ↗

광고

다음 뉴스 →

중요StepFun, 에이전트 작업 특화 플래그십 'Step 5 Preview' 공개

600B MoE·1M 컨텍스트에 10/15 오픈웨이트 예정. 금융·SWE 에이전트 자체 구축 대안으로 검토할 만.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스