← promppy_ 실시간 AI 뉴스
참고Reddit

M2 Ultra 기반 로컬 RAG 스택 구성: Qwen3, MCP, MLX 활용 사례

로컬 환경에서 Qwen3 모델과 MCP, MLX를 결합해 읽기/쓰기가 가능한 RAG 스택 구축 경험 공유.

요약

한 개발자가 M2 Ultra 128GB Mac Pro 환경에서 1500개의 위키 페이지를 처리하는 로컬 RAG 스택을 구축했다. 검색 단계에서는 Qwen3-Embedding-4B와 BM25를 결합하고 RRF 및 bge-reranker-v2-m3로 재순위화하며, 특정 임계값 미만 시 답변을 거부해 품질을 관리한다. 쓰기 단계에서는 Qwen3.6-27B(8-bit MLX) 모델이 검색된 증거를 기반으로 초안을 작성하고 템플릿에 맞춰 출처를 표기하며 스스로 검토한다. 모든 모델은 MLX 프레임워크를 통해 로컬에서 구동되며 테스트 및 모니터링을 위한 HTML 대시보드를 포함한다. 현재 106개의 스텁 페이지를 작성하는 등 시스템 효율성을 높이는 테스트를 진행 중이다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Built a local RAG stack for our wiki that will read and write for users - M2 Ultra 128GB

원문 보기 ↗
다음 뉴스 →

중요Cursor, 팀·엔터프라이즈 요금제에 토큰당 추가 마진 부과 확인

저가 모델일수록 100만 토큰당 $0.25 마크업 비중 폭증. Cursor 팀/엔터프라이즈 요금 구조 재점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스