TECH 으로 돌아가기
TECH HACKER NEWS 오늘 6분 읽기 29 READS

AI에게 색연필로 모나리자를 그리게 하면? GPT·Claude·Gemini·Grok 그림 실력 비교

AI에게 색연필로 모나리자를 그리게 하면? GPT·Claude·Gemini·Grok 그림 실력 비교

이미지 생성 모델 없이 '직접' 그리게 하기

재미있는 실험이 하나 공개됐어요. GPT-5.6, Claude, Gemini, Grok 같은 최신 AI 모델들에게 색연필로 모나리자를 그리게 시킨 건데요. "AI가 그림 그리는 거야 이제 흔한 일 아니야?"라고 생각하실 수 있지만, 여기엔 중요한 반전이 있어요. 이 실험은 DALL-E나 미드저니 같은 이미지 생성 모델을 쓰지 않았거든요. 텍스트를 다루는 언어 모델(LLM)에게 그리기 도구를 쥐여주고, 말 그대로 '직접' 그리게 한 거예요.

이게 뭐냐면 이런 거예요. 이미지 생성 모델은 노이즈에서 시작해 그림을 한 번에 '뽑아내는' 방식이라면, 이 실험에서 언어 모델은 사람이 그림을 그리듯 선 하나하나를 명령으로 그려요. "이 좌표에서 저 좌표까지 갈색 선을 긋고, 이 영역은 살구색으로 칠하고" 같은 식으로요. 기술적으로는 SVG(도형과 좌표를 코드로 표현하는 벡터 그래픽 형식)나 캔버스 API 명령을 출력하는 건데, 결국 모델이 머릿속으로 모나리자의 구도를 떠올리고, 그걸 수백 개의 좌표와 색상 명령으로 번역해내야 하는 거죠.

왜 이게 어려운 일이냐면

사람한테는 쉬워 보여도 언어 모델에게는 굉장히 어려운 과제예요. LLM은 기본적으로 '다음 단어 맞히기'로 학습된 모델이라, 2차원 공간에서 얼굴의 비례나 손의 위치 같은 걸 좌표로 정확히 배치하는 능력이 저절로 생기지 않거든요. 눈, 코, 입이 어디쯤 있어야 하는지 '말로는' 완벽하게 설명할 수 있어도, 그걸 숫자 좌표로 옮기는 순간 눈이 이마에 붙거나 미소가 일그러지는 일이 벌어져요.

그래서 이런 실험이 단순한 재미를 넘어 의미가 있어요. 모델의 공간 추론 능력(머릿속으로 위치와 형태를 상상하는 능력)과 그걸 코드로 정확히 옮겨내는 능력을 동시에 테스트하는 거니까요. 실제로 결과를 보면 모델마다 개성이 뚜렷하게 갈려요. 어떤 모델은 전체 구도는 그럴듯하게 잡는데 디테일이 무너지고, 어떤 모델은 색감 표현은 좋은데 얼굴이 추상화처럼 되어버리는 식이죠. 같은 과제를 받아도 접근 방식 자체가 다르다는 게 흥미로운 지점이에요.

'자전거 타는 펠리컨'의 계보를 잇는 실험

사실 이런 류의 벤치마크에는 계보가 있어요. 개발자 사이먼 윌리슨이 새 모델이 나올 때마다 "자전거 타는 펠리컨을 SVG로 그려줘"라고 시키는 게 유명한데요. 왜 하필 이런 엉뚱한 과제냐면, 공식 벤치마크에는 모델이 학습 과정에서 문제를 미리 봐버리는 '오염' 문제가 있거든요. 수학 문제 점수가 높은 게 실력인지, 정답을 외운 건지 구분이 안 된다는 거죠. 반면 펠리컨이 자전거 타는 그림 같은 건 학습 데이터에 정답이 있을 리 없으니 모델의 진짜 실력이 드러나요. 이번 모나리자 실험도 같은 맥락인데, 한 가지 장점이 더 있어요. 모나리자는 누구나 아는 원본이 존재하니까, 결과물을 보고 전문가가 아니어도 직관적으로 "잘 그렸네, 이상하네"를 판단할 수 있다는 거예요.

실무에서도 은근히 쓸모 있는 능력이에요

"그래서 이게 실무랑 무슨 상관이야?" 싶으실 텐데, 의외로 관련이 있어요. LLM에게 SVG나 다이어그램을 그리게 하는 건 이미 실무에서 쓰이고 있거든요. 아키텍처 다이어그램 초안 뽑기, 간단한 아이콘이나 일러스트 시안 만들기, Mermaid 같은 다이어그램 코드 생성이 대표적이죠. 이런 작업의 품질이 바로 이 '공간 추론 + 코드 생성' 능력에 달려 있어요. 모나리자를 잘 그리는 모델이 여러분의 시퀀스 다이어그램도 잘 그릴 가능성이 높은 거예요.

또 하나 배울 점은 나만의 미니 벤치마크를 만들어두는 습관이에요. 새 모델이 나올 때마다 공식 점수만 보지 말고, 내 업무에서 자주 시키는 과제 몇 개를 고정해두고 돌려보는 거죠. 그러면 모델 선택이 벤치마크 표가 아니라 내 일에 근거를 두게 되거든요.

정리하면, 이 실험은 "AI가 그림을 그린다"가 아니라 "언어 모델이 공간을 얼마나 이해하는가"를 보여주는 창이에요. 여러분이라면 새 모델의 실력을 확인할 때 어떤 '나만의 테스트'를 시켜보고 싶으세요?


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://www.tryai.dev/blog/ai-drawing-arena-colored-pencils-...
SHARE
처리 중...