참고AI타임스
연구진, LLM 내부 '고통 벡터' 발견... 모델 제어 가능성 제시
모델 내부 표현을 특정 방향으로 조작해 출력을 제어하는 연구입니다. 모델 해석 가능성(Interpretability) 연구의 최신 사례입니다.
요약
미국 미래영향그룹(FIG)과 보훔 루르대학교 연구진은 대형언어모델(LLM) 내부에서 '고통 방향(Pain Direction)'이라 불리는 특정 벡터가 형성된다는 연구 결과를 14일 발표했다. 연구진은 2B에서 72B 규모의 오픈웨이트 AI 모델 25개를 분석한 결과, 모델이 고통 개념을 단순한 언어 패턴을 넘어 내부적으로 구분해 표현하고 있음을 확인했다. 특히 이 고통 관련 벡터를 인위적으로 조작할 경우, 모델의 출력과 행동이 고통을 회피하는 방향으로 일관되게 변화하는 현상이 나타났다. 이는 AI가 인간의 고통과 유사한 개념을 모델 내부에서 구조적으로 처리하고 있음을 시사한다. 이번 연구는 AI 모델이 학습된 정보를 바탕으로 특정 행동 양식을 능동적으로 수행할 가능성을 보여준다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 LLM 내부에서 '고통 축' 발견..."회피 행동까지 수행"
원문 보기 ↗