← promppy_ 실시간 AI 뉴스
참고X

Taalas 칩셋, Qwen3.8-27b 로컬 구동 가능성 제시

ASIC에 모델 가중치를 직접 식각하는 Taalas 기술의 하드웨어 가속 성능이 실무 환경의 추론 속도를 획기적으로 개선할 수 있음.

요약

하드웨어 스타트업 Taalas가 모델 가중치를 ASIC에 직접 각인하는 기술을 통해 Llama 3.1 8b 모델을 초당 17,000토큰(tok/s)의 속도로 구동하는 데 성공했다. 향후 개인용 AMD 하드웨어 장치를 통해 Qwen 3.8-27b 모델을 초당 5,000토큰(tps) 속도로 처리할 수 있는 제품 출시 가능성이 제기되었다. Taalas의 기술은 소프트웨어 기반 추론 방식과 달리 하드웨어 단계에서 연산을 최적화하여 압도적인 처리 속도를 구현한다. 향후 Qwen이나 Gemini와 같은 다양한 대형 언어 모델에도 이 기술이 적용될 것으로 기대된다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @jun_song: Maybe 5,000tps Qwen3.8-27b personal AMD hardware box is coming soon. Taalas runs Llama 3.1 8b with 17,000tok/s It etches the model

원문 보기 ↗
다음 뉴스 →

중요앤트로픽, Claude 안전 분류기 고도화… 생물학 질문 오탐 답변 거부 85% 감소

정상 요청을 위험으로 오판해 막던 문제 완화. 연구·의료·교육 도메인 활용도 재검토 가치.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스