← promppy_ 실시간 AI 뉴스
중요X

텐센트 Hy4 프리뷰, 770B(활성 49B) 모델 배포 문턱 낮춰…1.5TB→214GiB GGUF

Apache 2.0 가중치라 자체 서빙 가능. 단 1M 컨텍스트·KV캐시 메모리는 별도 산정 필수.

요약

Hy4 프리뷰 모델은 770B 파라미터(활성 49B) 규모임에도 텐센트 평가 기준 성능 하락을 최소화하며 배포 문턱을 대폭 낮췄다. 모델 가중치는 기존 약 1.5TB(BF16)에서 약 214GiB(혼합 GGUF) 수준으로 줄어들어 자체 서버 구축 및 Apache 2.0 라이선스 기반의 자유로운 운용이 가능하다. 벤치마크 결과 SWE-Bench multi 81.3, MCP Atlas 83.2, MRCR 81.1, IFBench 72.5 등 기존 BF16 대비 소폭의 성능 감소만 기록했다. 배포 방식은 vLLM/SGLang을 활용한 공식 FP8 방식과 패치된 llama.cpp를 통한 혼합 GGUF 방식 중 선택할 수 있다. 1M 컨텍스트를 지원하지만, 실제 운영 시 가중치와 KV 캐시, 동시성을 고려한 메모리 설계가 필수적이다. 현재 프리뷰 단계이므로 실제 업무 적용 전 BF16/FP8과 GGUF 간의 성능 및 토큰/초 처리량을 직접 비교해야 한다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @hqmank: Hy4 preview lowers the deployment bar for a 770B model (49B active), with small quality drops on Tencent's reported evals. ~1.5TB

원문 보기 ↗

광고

다음 뉴스 →

중요카카오, 10월 '이프카카오 26'서 에이전틱 AI 비전 공개

카나나 모델 로드맵·에이전트 전략 공개 예정. 카카오 생태계 연동 서비스라면 체크할 자리.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스