중요X
GPT-6 Astra, 3D 공간 추론 벤치마크 MazeBench서 14%…60시간 소요
공간·물리 추론은 여전히 약점. 3D 내비게이션·로보틱스 유스케이스라면 LLM 단독 의존은 위험.
원문 제목 @patience_cave: MazeBench vs GPT-6 Astra Astra spent 60+ hours in this 3D open world spatial reasoning eval. Final score: 14% https://t.co/ft7mPrp
원문 보기 ↗