참고팁Hacker News
로컬 에이전트 추론 엔진 'Magnitude' 공개…하드웨어 최적화로 성능 향상
하드웨어별 커널 컴파일을 통해 추론 속도를 최대 2배 개선. 로컬 LLM 기반 에이전트 운영 시 llama.cpp의 대안으로 검토 가능.
요약
Magnitude는 에이전트를 위한 오픈소스 추론 엔진으로, 사용자의 하드웨어 환경에 맞춰 커널을 컴파일하고 튜닝하여 최적화된 성능을 제공한다. 이 엔진은 llama.cpp 대비 최대 2배 빠른 실행 속도를 구현하며, Apple Silicon, NVIDIA, AMD GPU 및 일반 CPU 환경을 모두 지원한다. 데스크톱 앱 형태로 제공되어 별도의 설치 과정 없이 CLI를 포함해 간편하게 이용할 수 있다. Pi, OpenCode, Hermes, Codex, Claude Code 등 기존에 사용 중인 에이전트와 클릭 한 번으로 연동 가능하다. 또한 OpenAI 호환 API를 통해 다양한 환경에서의 확장이 가능하며, 모든 데이터는 로컬 환경에서 처리되어 보안성을 유지한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agents
원문 보기 ↗