러시아 스타트업 Mostik, 모델 간 '웨이트 공유'로 소형 모델 성능 극대화
모델 가중치(weights)를 직접 공유해 소형 모델이 대형 모델의 능력을 효율적으로 활용하는 새로운 접근법을 제시함.
요약
러시아 스타트업 Mostik이 AI 모델들이 언어적 교환 없이 수학적 가중치 값을 직접 공유해 소통하는 '머신 텔레파시' 방식의 통신 기술을 개발했다. 이 기술은 대형 모델의 능력을 소형 모델에 효율적으로 전이시켜 성능을 크게 향상시킬 수 있는 것이 특징이다. Mostik은 이 방식을 활용해 난도가 높은 AI 대회인 ARC-AGI 3에서 상위권에 오르는 성과를 거두었다. 실제 사례로 7530억 파라미터인 GLM-5.2와 40억 파라미터인 Qwen-3.5 모델을 연결한 결과, 단독 대형 모델 대비 20분의 1 비용으로 두 모델의 중간 수준 성능을 구현했다. Sasha Malysheva CEO는 이 기술이 AI 앙상블 모델의 효율성을 극대화하는 새로운 방안이 될 것이라고 설명했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 These Russian Mathematicians Taught AI Models How to Talk to Each Other Without Using Words
원문 보기 ↗