중요Reddit
Claude·GPT의 숨겨진 추론 토큰 100% 추출 논문 화제
벤치마크 답 암기 정황 포착. 프론티어 모델 성능 지표를 곧이곧대로 신뢰하지 말 것.
요약
최근 공개된 연구 'Stealing Reasoning Traces from Proprietary LLM APIs'를 통해 Claude와 GPT 등 주요 모델의 내부 추론 토큰을 100% 가시화할 수 있는 취약점이 발견되었습니다. 연구진은 공개된 예시들을 통해 프론티어 모델의 추론 과정을 상세히 분석했습니다. 특히 AIME 벤치마크 문제에서 Claude가 이미 정답을 학습하고 있었다는 정황이 포착되어, 기존 벤치마크 성능 수치가 과대평가되었을 가능성이 제기됩니다. 또한, 오픈소스 모델에서 나타나는 이상한 문구나 과도한 추론(Overthinking) 현상이 프론티어 모델에서도 빈번하게 발생한다는 사실이 확인되었습니다. 이번 연구는 폐쇄형 모델의 내부 메커니즘을 파악하고 AI 모델의 실제 성능을 검증하는 데 중요한 시사점을 제공합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Hidden Reasoning from Claude and GPT are Decoded, and it is interesting
원문 보기 ↗