최신 AI 모델, 모나리자 '그리기' 대결: GPT-5.6, Claude, Gemini, Grok 성능 비교
"Drawing" the Mona Lisa with GPT-5.6, Claude, Gemini, and Grok · TryAI
💡 최신 AI 모델들이 가상 도구로 모나리자를 그리는 실험에서 GPT-5.6 Sol이 가장 뛰어난 시각적 결과물을 보여주었으나, 구조적 유사도(SSIM) 점수에서는 Gemini 3.6 Flash가 가장 높게 나왔습니다.
핵심 요약
- 무엇을 · 최신 대규모 언어 모델(LLM)인 GPT-5.6 Sol, Claude Fable 5, Gemini 3.6 Flash, Grok 4.5가 가상의 색연필 도구를 사용하여 모나리자 등 특정 이미지를 재현하거나 텍스트 프롬프트에 따라 그림을 그리는 능력을 평가했습니다.
- 어떻게 · 각 모델에게 빈 캔버스와 색연필 도구 세트(색상, 팁 너비, 압력 조절, 스머지, 지우개, 캔버스 보기 기능 포함)를 제공하고, 목표 이미지에 대한 구조적 유사도(SSIM)를 기준으로 진행 상황과 최종 결과물을 평가했습니다. 모델들은 스스로 그림을 그리고 수정하는 과정을 반복했습니다.
- 결과 · GPT-5.6 Sol은 시각적으로 가장 만족스러운 결과물과 세부 묘사 능력을 보여주며 '압도적인 선두'로 평가받았습니다. 반면, Gemini 3.6 Flash는 SSIM 점수에서 가장 높았지만, 실제 사람이 보기에 가장 유사한 그림은 아니었습니다. Claude Fable 5는 품질 면에서 2위였으나 비용과 시간이 매우 많이 소요되었고, Grok 4.5는 '거의 쓸모없는' 결과물을 내놓으며 시각적 이해 및 판단 능력이 부족하다는 평가를 받았습니다.
왜 중요한가
이 실험은 최신 AI 모델들이 텍스트 생성뿐만 아니라 시각적 정보를 이해하고 재현하는 능력, 즉 '그리기'와 같은 복잡한 작업을 수행하는 잠재력을 보여줍니다. 이는 AI의 다중 모달 능력 발전과 실제 세계에서의 응용 가능성을 가늠하는 중요한 지표가 됩니다.
실생활·산업 영향
AI가 시각적 콘텐츠를 생성하고 편집하는 능력이 향상되면, 디자인, 예술, 미디어, 교육 등 다양한 산업에서 새로운 도구와 워크플로우를 창출할 수 있습니다. 예를 들어, AI 기반의 자동화된 일러스트레이션, 컨셉 아트 생성, 이미지 편집 보조 등의 분야에 활용될 수 있습니다.
한계·주의
SSIM 점수가 반드시 사람이 인지하는 '좋은 그림'과 일치하지 않는다는 점이 한계로 지적되었습니다. 또한, 모델별로 도구 사용 방식과 효율성이 크게 달랐으며, 특히 Grok 4.5와 같이 아직 시각적 작업에 부적합한 모델도 있었습니다. Gemini 3.6 Flash는 최신 프론티어 모델과 비교하기에는 다소 불공평할 수 있다는 점도 언급되었습니다.
※ 이 요약은 AI 보조로 생성하고 사람이 검수했습니다. 난이도·실생활 영향·톤은 본 사이트의 편집 의견이며, 정확한 내용은 반드시 원문(arXiv)을 확인하세요. 번역은 AI 기반으로 오역 가능성이 있습니다. 출처: arXiv (a-tryai-dev-20260721-blog-ai-drawing-arena-colored-pencils-c).
← 테크랩 전체 보기