참고X
오디오 입력 LLM으로 음성 생성하는 '스피치 딥드림' 실험 화제
모델 가중치를 고정한 채 오디오 전사 확률을 최적화하여 임의의 음성을 생성하는 실험적 기법.
요약
X 사용자 @matthen2는 오디오 입력을 받는 LLM이 내부적으로 음성 생성 능력을 갖추고 있음을 확인하는 실험 결과를 공유했다. 해당 연구자는 LLM 모델을 고정한 상태에서 특정 전사(transcription) 내용이 나올 확률을 최적화하는 방식을 사용하여 소음 오디오로부터 음성을 생성해냈다. 그 결과 생성된 음성은 마치 '공포 영화 속 악마'와 같은 기괴한 형태의 소리를 내는 것으로 나타났다. 이는 이미지 생성 분야의 '딥드림(DeepDream)' 기법을 음성 분야에 적용한 사례와 유사하다. 이번 실험은 멀티모달 LLM이 단순히 텍스트 이해를 넘어 음성 생성에 대한 잠재적 가능성을 지니고 있음을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @matthen2: does your audio-input LLM secretly know how to generate speech? yes but it sounds like a scary demon! deepdream but for speech: st
원문 보기 ↗