Karpathy가 분석한 절차적 생성의 병목: LLM의 '시각적 피드백 루프' 한계
복잡한 시각 작업 자동화 시, 생성 후 브라우저 렌더링과 시각 모델의 검증 루프가 필수적임을 시사.
요약
Andrej Karpathy는 Opus 5 모델에 1M 토큰을 할당해 'Lord of the Rings' 도입부를 5,500줄의 Three.js 코드로 구현하는 실험을 진행했다. 실험 결과, 거대 언어 모델이 방대한 3D 장면을 생성할 수 있는 능력을 갖췄으나 자신의 시각적 결과물을 스스로 검증하는 데는 한계가 있음이 드러났다. 실제 WebGL 절차적 생성 실험에서도 LLM이 작성한 코드에는 공중에 떠 있는 메쉬나 클리핑 오류 등 시각적 결함이 자주 발생했다. 이를 해결하기 위해서는 헤드리스 브라우저로 뷰포트 스크린샷을 캡처한 뒤, 이를 비전 모델에 다시 전달하여 레이아웃을 검사하는 피드백 루프가 필수적이다. 즉, LLM 기반 절차적 생성의 핵심 병목 현상은 코드 작성 자체가 아닌 생성된 결과물의 시각적 피드백 과정에 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Karpathy LOTR Threejs experiment highlighted the real bottleneck in procedural generation: the vision feedback loop
원문 보기 ↗