프랑수아 숄레: GPT-6 Astra, 상호작용 추론에서 계단식 도약… ARC-AGI-3 66% 기록
모델이 자체 DSL로 게임 상황을 심볼릭 모델링. 에이전트 추론 설계 방식의 구조적 변화 신호.
요약
François Chollet이 X를 통해 공개한 GPT-6 Astra는 대화형 추론 문제에서 획기적인 성능 변화를 보여주며, ARC-AGI-3 벤치마크 표준 하니스 기준 66%의 점수를 기록했습니다. 연속 대화 하니스와 맞춤형 컴팩션을 사용할 경우 점수는 거의 100%에 달하며, 이는 게임당 약 360달러의 비용이 소요됩니다. 해당 모델은 연속 하니스 버전에서 인간의 기준치를 넘어서는 효율성을 보였으며, 게임마다 즉각적인 상징적 세계 모델링을 수행합니다. 특히 게임 내 상황을 표현하기 위해 독자적인 약어 DSL을 생성하는 등 고도의 상징적 모델링 행동을 보여주었습니다. 이는 과거 정교한 외부 하니스에서만 가능했던 기능들이 모델 자체의 능력으로 내재화되고 있음을 의미하며, Astra는 모델 지능 측면에서 주요한 돌파구로 평가됩니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @fchollet: GPT-6 Astra represents a step-function change in model capability for interactive reasoning problems. It scores 66% on ARC-AGI-3 u
원문 보기 ↗