텐센트 Hy4 프리뷰, 770B(활성 49B) 모델 배포 문턱 낮춰…1.5TB→214GiB GGUF
Apache 2.0 가중치라 자체 서빙 가능. 단 1M 컨텍스트·KV캐시 메모리는 별도 산정 필수.
요약
Hy4 프리뷰 모델은 770B 파라미터(활성 49B) 규모임에도 텐센트 평가 기준 성능 하락을 최소화하며 배포 문턱을 대폭 낮췄다. 모델 가중치는 기존 약 1.5TB(BF16)에서 약 214GiB(혼합 GGUF) 수준으로 줄어들어 자체 서버 구축 및 Apache 2.0 라이선스 기반의 자유로운 운용이 가능하다. 벤치마크 결과 SWE-Bench multi 81.3, MCP Atlas 83.2, MRCR 81.1, IFBench 72.5 등 기존 BF16 대비 소폭의 성능 감소만 기록했다. 배포 방식은 vLLM/SGLang을 활용한 공식 FP8 방식과 패치된 llama.cpp를 통한 혼합 GGUF 방식 중 선택할 수 있다. 1M 컨텍스트를 지원하지만, 실제 운영 시 가중치와 KV 캐시, 동시성을 고려한 메모리 설계가 필수적이다. 현재 프리뷰 단계이므로 실제 업무 적용 전 BF16/FP8과 GGUF 간의 성능 및 토큰/초 처리량을 직접 비교해야 한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @hqmank: Hy4 preview lowers the deployment bar for a 770B model (49B active), with small quality drops on Tencent's reported evals. ~1.5TB
원문 보기 ↗