← promppy_ 실시간 AI 뉴스
참고Hacker News

멀티모달 모델 그리기 능력 비교: GPT-5.6부터 Grok 4.5까지

주요 모델들의 캔버스 도구 활용 능력을 구조적 유사성(SSIM)으로 검증. 오픈소스 하네스로 직접 테스트 가능.

요약

최근 4종의 주요 비전 모델(GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash)을 대상으로 캔버스에 그림을 그리게 하는 '드로잉 아레나' 실험이 진행되었습니다. 모델들은 색상, 펜 두께, 압력을 조절하고 지우개 기능을 활용하며 모나리자와 고흐의 '별이 빛나는 밤'을 재현하거나 텍스트 프롬프트에 맞춰 그림을 그렸습니다. 연구팀은 모델이 스스로 결과물을 확인하고 수정하는 과정에서 구조적 유사성(SSIM) 점수를 측정하며 도구 사용 능력, 비용, 결과물의 품질을 분석했습니다. 이번 테스트는 모델의 예술적 창의성을 평가하기보다는 비정형 작업에서의 성능을 확인하기 위한 실험적 성격을 띱니다. 실험에 사용된 전체 도구와 환경은 오픈소스(github.com/hershalb/canvas-arena)로 공개되어 누구나 직접 테스트해 볼 수 있습니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 "Drawing" the Mona Lisa with GPT-5.6, Claude, Gemini, and Grok

원문 보기 ↗
다음 뉴스 →

중요Kimi K3 에이전트 32개, Redis에서 27분 만에 RCE 익스플로잇 발견

AI 에이전트 병렬 퍼징이 실전 취약점 탐지에 도달. 방어·공격 양쪽 모두 검증 워크플로 재점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스