참고Reddit
GPT-2 임베딩 공간 속성 분석: 이산적 vs 연속적 표현의 차이
토큰 임베딩의 표현 방식(이산/연속)이 모델의 연관 단어 추론 결과에 미치는 기술적 차이를 분석한 사례.
요약
최근 머신러닝 커뮤니티에서 GPT-2 Small의 정적 임베딩 테이블 내 'Trump' 토큰에 대한 임베딩 기하학 분석 결과가 주목받고 있다. 어텐션이나 문맥 적용 이전의 32,070개 알파벳 토큰을 t-SNE로 투영하여 분석한 결과, 동일한 임베딩을 다루는 방식에 따라 근접 이웃 도출 결과가 달라졌다. 좌표 값을 임계값으로 처리한 'Discretized' 방식에서는 Mitt, Hillary 등 일반적인 정치 용어가 주로 나타났다. 반면 좌표 값을 그대로 유지한 'Continuous' 방식에서는 오바마, 클린턴 등 보다 구체적인 인물군이 도출되었다. 이 분석은 별도의 프롬프트나 텍스트 생성 과정 없이 GPT-2 Small의 학습된 토큰 임베딩 자체만을 사용해 수행되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 GPT-2 Small’s embedding geometry around “Trump”: discretized vs. continuous nearest neighbours [P]
원문 보기 ↗