참고Reddit
물리 시뮬레이션 기반 LLM 벤치마크: Claude Opus 5 성능 1위
물리적 정밀도와 추론 능력을 요하는 태스크에서 Claude 5 시리즈가 경쟁 모델 대비 높은 성능을 보임.
요약
최근 Reddit에서 10개의 LLM을 대상으로 물리 시뮬레이션 환경에서 블록을 쌓아 탑을 만드는 성능 벤치마크 실험이 진행되었습니다. 각 모델은 툴 API를 사용해 블록 30개를 배치했으며, 위치와 속도 중 하나만 정밀하게 제어할 수 있는 노이즈 환경에서 최종적으로 세워진 탑의 높이를 측정했습니다. 실험 결과 Claude Opus 5가 평균 8.52m를 기록하며 1위를 차지했고, Claude Sonnet 5가 8.46m로 그 뒤를 이었습니다. 3위는 7.81m를 기록한 Claude Fable 5였으며, GPT-5.5는 7.79m로 4위에 머물렀습니다. 특히 GPT-5.5는 Claude 시리즈보다 훨씬 적은 토큰(99k)을 사용하면서도 상위권 성적을 거둬 토큰 효율성 측면에서 높은 경쟁력을 보였습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I benchmarked 10 LLMs on building towers in a physics sim. Claude Opus 5 won
원문 보기 ↗