← promppy_ 실시간 AI 뉴스
참고Reddit

MLX-serve로 Qwen3.8-Flash-Next 100만 컨텍스트 구동 최적화 팁

M5 Max 128GB 환경에서 iogpu 파라미터 튜닝을 통해 긴 컨텍스트를 안정적으로 처리하는 설정법.

요약

MLX-serve가 Qwen3.8-Flash-Next 모델 엔진을 지원하며 최대 100만(1m) 토큰의 컨텍스트를 처리할 수 있게 되었다. 해당 모델은 M5 Max 128GB 환경에서 KV 캐시 8비트 양자화를 적용해 최적화되었으며, 100만 토큰 컨텍스트 유지 상황에서 산문은 초당 약 40토큰, 코딩은 초당 약 75토큰의 생성 속도를 보인다. 밀집(dense) 레이어에는 8비트, 전문가(expert) 레이어에는 4비트 양자화를 적용하여 긴 문맥에서도 모델 품질을 높게 유지했다. 개발자는 단순 속도 과시가 아닌 온도 1.0 샘플링을 통한 실사용 환경에서의 성능 검증에 초점을 맞췄다고 설명했다. 이를 활용하려면 iogpu.wired_limit_mb 설정을 120,000으로 조정해야 한다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Qwen3.8-Flash-Next on MLX-serve, 1m context is released!

원문 보기 ↗

광고

다음 뉴스 →

중요미국, 딥시크·문샷 등 중국 AI 기업 6곳 '미국 기술 악의적 복제' 지목

증류 방식 IP 갈등 격화. 중국 오픈 모델을 서비스에 쓴다면 규제·법적 리스크 재점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스