Ollama(올라마)/MLX 호환 API 서버 'superfluid' 공개: 세션 복구 및 QoS 기능 제공
로컬 LLM 서버 사용 시 세션 유실 방지와 우선순위 기반 요청 처리가 가능해져 생산 환경에서 안정적 운영 가능.
요약
Reddit의 r/ollama에서 주목받고 있는 오픈소스 프로젝트 'superfluid'는 llama.cpp 및 MLX 기반의 로컬 LLM 서버를 안정적으로 운영하기 위한 데몬입니다. 이 도구는 OpenAI, Anthropic, Ollama와 호환되는 API를 지원하여 기존 클라이언트와 원활하게 연동됩니다. 핵심 기능인 write-ahead log를 통해 서버가 갑자기 중단되어도 토큰 기록이 보존되어 세션을 복구할 수 있습니다. 또한, QoS(서비스 품질) 클래스 기능을 도입해 사용자 대화 요청을 에이전트 작업보다 우선 처리하는 선점형 스케줄링을 지원합니다. 기존 로컬 서버 운영 시 발생하던 세션 소실 문제나 대기열 정체 문제를 해결하고자 개발되었습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I built a local server that speaks the Ollama API - sessions survive crashes, and your chat doesn't wait behind your agents
원문 보기 ↗