← promppy_ 실시간 AI 뉴스
참고X

rapid-mlx 0.12.15 출시, Qwen3.8-27B 추론 속도 1.25배 향상

로컬 LLM 구동 시 Speculative Decoding 지원 및 에이전트 파일 쓰기 오류가 수정되어 관련 도구 사용자는 업데이트 권장.

요약

rapid-mlx가 버전 0.12.15를 출시하며 Qwen3.8-27B 모델에 대한 무손실 MTP 추측 디코딩 기능을 추가해 속도를 1.25배 향상시켰다. 이번 업데이트에는 Claude Code나 Aider 등 코딩 에이전트 사용 시 파일 내용이 짧아지는 버그가 해결되어 즉각적인 업그레이드가 권장된다. 모델 다운로드 속도가 80~90MB/s로 개선되어 9B 모델 기준 약 2분이면 채팅이 가능해졌으며, 속도 저하 시 자동 경로 재설정 기능도 도입됐다. Whisper 사용 시 정적 상태에서 단어를 임의로 생성하던 문제도 개선되었다. 보안 측면에서는 모델 다운로드 시 코드 실행을 차단하고 모든 파일에 대한 무결성 검사를 수행하도록 강화되었다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @Raullen: rapid-mlx 0.12.15 is out 🐆 ⚡️ We just shipped lossless MTP speculative decoding for Qwen3.8-27B, 1.25x faster! Just one flag: rap

원문 보기 ↗
다음 뉴스 →

중요Cerebras, GPU 대비 추론 30배 빠른 랙 규모 시스템 'CS-4' 공개

WSE-3 Turbo 3개로 와트당 처리량 10배. 대규모 추론 인프라 GPU 대안 검토 여지.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스