← promppy_ 실시간 AI 뉴스
참고Reddit

LLM 기억 계층의 취약점: 반복적인 거짓 정보 주입 시 신뢰도 점수 왜곡 확인

거짓 정보를 반복 학습시킬 경우 모델의 신뢰도 점수가 오히려 상승하는 현상 발견. RAG 및 메모리 시스템 설계 시 참고할 만한 실험 결과.

요약

최근 Reddit의 r/LLMDevs 커뮤니티에서 LLM의 기억 계층(Memory Layer)이 반복되는 거짓 정보에 취약하다는 실험 결과가 공유됐다. 실험자는 질문에 대해 모델이 모를 경우 "모른다"고 답하도록 설계된 신뢰도 게이트(Confidence Gate)를 구축했으며, 정직한 질문에는 0.956의 AUROC를 기록하며 정확하게 작동했다. 그러나 동일한 주제에 대해 진실을 한 번 말한 뒤 거짓 정보를 3회 반복 입력하자, 모델은 거짓을 100% 사실로 받아들였다. 놀라운 점은 거짓 정보가 입력될수록 모델의 신뢰도 점수가 4.45에서 6.6으로 오히려 상승했다는 사실이다. 실험 결과 거짓 정보가 3회 이상 반복될 경우, 데이터 샘플 크기와 관계없이 모델은 단 한 번도 올바른 정답을 내놓지 못했다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 3 repetitions of a lie beat the truth 100% of the time in my memory layer, and the confidence score goes UP

원문 보기 ↗

광고

다음 뉴스 →

중요텐센트 Hy4 프리뷰, 770B(활성 49B) 모델 배포 문턱 낮춰…1.5TB→214GiB GGUF

Apache 2.0 가중치라 자체 서빙 가능. 단 1M 컨텍스트·KV캐시 메모리는 별도 산정 필수.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

최신 뉴스