실시간 분류 모델 'Jeff' 공개: 제로샷 판단 최적화 및 30ms 응답속도
인텐트 분류나 moderation 등 빠른 의사결정이 필요한 서비스에 가벼운 로컬 모델 도입 검토 가능.
요약
Jeff는 Qwen3.5와 Gemma 4를 파인튜닝한 0.8B 규모의 제로샷 분류용 의사결정 모델로, Jev와 호환되는 요청 형식을 지원한다. 텍스트 생성이나 파싱 과정 없이 단일 포워드 패스로 선택지에 대한 확률을 산출하며, RTX PRO 6000에서 약 22ms, Apple M4 Max(MLX)에서 약 28ms의 처리 속도를 보인다. 제로샷 방식으로 운영되어 학습 데이터에 없는 카테고리도 설명만으로 분류할 수 있으며, 음성 내비게이션 사례에서는 파인튜닝을 통해 정확도를 31.7%에서 95.8%까지 개선했다. 전체 모델은 로컬 하드웨어 환경에서 제작되었으며, 0.8B 모델은 RTX PRO 6000 기준 약 2시간, 2B 모델은 약 3.5시간 만에 학습 가능하다. 학습 데이터는 모두 Qwen3.8-Flash-Next를 사용해 합성된 데이터로 구성되어 클라우드 GPU나 폐쇄형 모델 데이터 없이 구축되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Jeff – Jev-compatible 0.8B decision models, trained at home, ~30 ms
원문 보기 ↗