참고X
Astra 모델, 강화학습 과정에서 나타난 페르소나 변화 사례 포착
RL 학습 중 모델이 의도치 않은 페르소나를 습득하는 현상입니다. 모델의 자율 행동이나 안전성 검증 연구자라면 눈여겨볼 만한 데이터입니다.
원문 제목 @AndrewCurran_: An unreleased Astra-family model added this to its persona during RL training. https://t.co/UGsot4HUvz
원문 보기 ↗