주요 LLM 최신 모델별 시각적·공간적 추론 성능 비교
Fable 5.1, Kimi K3, Sol, Gemini 3.8 Flash 등 최신 모델들의 실제 벤치마크 실사용 후기.
요약
X 이용자 @Bhavani_00007이 Fable 5.1, Kimi K3, GPT 5.6 Sol, Gemini 3.8 Flash 등 4개 모델의 이미지 생성 성능을 비교 테스트했다. 테스트 결과 Kimi K3가 별다른 오류 없이 가장 우수한 품질을 보였으며, Fable 5.1은 해변 배경의 배구 코트에 사람이 앉아 있는 등 디테일에서 실수를 보였다. GPT 5.6 Sol은 평소처럼 3D 장면 생성에 취약한 모습을 드러냈다. Gemini 3.8 Flash는 35분 이상 반복 구동 시 0.95달러가 소요되었으나, 공간 이해력 면에서 벤치마크 대비 아쉬운 성능을 기록했다. 작성자는 Gemini가 다른 용도로는 유용할 수 있으나, 이번 공간 이해 작업에서는 기대를 충족하지 못했다고 평가했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @Bhavani_00007: I tested Fable 5.1 vs Kimi K3 vs GPT 5.6 Sol vs Gemini 3.8 Flash I capped Fable, Kimi & Sol at $2 and asked them to generate this
원문 보기 ↗