멀티모달 모델 그리기 능력 비교: GPT-5.6부터 Grok 4.5까지
주요 모델들의 캔버스 도구 활용 능력을 구조적 유사성(SSIM)으로 검증. 오픈소스 하네스로 직접 테스트 가능.
요약
최근 4종의 주요 비전 모델(GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash)을 대상으로 캔버스에 그림을 그리게 하는 '드로잉 아레나' 실험이 진행되었습니다. 모델들은 색상, 펜 두께, 압력을 조절하고 지우개 기능을 활용하며 모나리자와 고흐의 '별이 빛나는 밤'을 재현하거나 텍스트 프롬프트에 맞춰 그림을 그렸습니다. 연구팀은 모델이 스스로 결과물을 확인하고 수정하는 과정에서 구조적 유사성(SSIM) 점수를 측정하며 도구 사용 능력, 비용, 결과물의 품질을 분석했습니다. 이번 테스트는 모델의 예술적 창의성을 평가하기보다는 비정형 작업에서의 성능을 확인하기 위한 실험적 성격을 띱니다. 실험에 사용된 전체 도구와 환경은 오픈소스(github.com/hershalb/canvas-arena)로 공개되어 누구나 직접 테스트해 볼 수 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 "Drawing" the Mona Lisa with GPT-5.6, Claude, Gemini, and Grok
원문 보기 ↗