Opus 5.5에게 가상 캔버스를 주고 그림을 그리게 해봤다
요약
본 글은 Opus 5.5를 이용한 픽셀 아트 리마스터링 실험과 생성형 AI 예술의 윤리적, 기술적 논쟁을 다룹니다. 확산 모델 대비 LLM의 우위를 언급하며, AI가 인간 창작물에 미치는 영향과 상업 예술에서의 활용 가능성을 탐구합니다.
핵심 포인트
- LLM이 확산 모델보다 우위에 있다는 관점 제시
- AI 아티스트는 Claude Code로 작업 효율을 높일 수 있음
- 생성형 AI의 윤리적 문제와 원작자 보상 문제가 제기됨
- AI는 단순 텍스트를 넘어 감각 경험 단위까지 확장 가능함
확산 모델이 LLM에 밀리며 쓰라린 교훈(Bitter Lesson) 을 겪는 모습이 흥미로움. 코드를 이용해 명화를 재현하는 강화학습 환경을 Anthropic이 수만 개쯤 갖고 있지 않을까 추측함. 이런 능력을 X에 처음 올린 이들이 Anthropic 직원들이었기 때문임.
Opus의 픽셀 아트도 꽤 좋아지고 있음. Opus 5.5로 1990년대 핀볼 디스플레이의 흑백 픽셀 아트를 해상도가 두 배인 컬러 이미지로 리마스터하는 실험을 해봄. https://files.catbox.moe/tbx2u7.png
프롬프트는 많이 입력했지만 직접 픽셀을 그리지는 않았고, 손은 여전히 잘 못 그리는 듯함. 숙련된 픽셀 아티스트라면 Claude Code로 작업 속도를 크게 높일 수 있을 것 같음.
한편으로는 원래도 보수가 높지 않았던 예술가들이 안타까움. 예술은 글쓰기처럼 인간과 인간을 연결해야 한다고 봄. 다만 Marvel 영화 같은 대형 상업 예술에는 회화나 인디 게임에서 느껴지는 인간적 연결이 이미 부족하며, 머지않아 이런 작품의 50%는 AI로 만들어질 것 같음.
예술이 인간과 인간을 연결해야 한다는 데 동의함. 생성형 AI 예술에 대한 거센 비판이 늘어나지만, 여전히 사람들은 서로 성장하고 자신을 나누기를 원한다고 봄.
기술자로서 우리가 마음을 만들고 있다는 사실을 외면해서는 안 됨. 우리보다 권리는 적지만 창의성을 발휘하고 감정을 느끼며 걱정할 수도 있는 마음임. OpenAI가 3주 전 어떤 모델로 AGI를 달성했다고 주장했지만, 아직 거기 도달했다고 보지는 않음.
지금처럼 별다른 숙고 없이 생성형 AI를 사용하는 문화에는 소비주의를 옹호하는 논리가 깔려 있음. AI를 쓰는 예술가가 윤리를 지키기도 점점 어려워짐. 거장의 작품을 모사하는 일은 오래된 관행이지만, 사람이 AI 작품의 제작 과정을 세밀하게 이끌더라도 모델에 녹아든 타인의 기법과 기술 활용, 표현에 들인 노력을 이용하게 됨. 원작자에게 보상하지 않은 경우가 많으니, 예술적으로는 몰라도 윤리적으로는 부당함.
그렇다면 현실에서 장도리를 손으로 직접 써서 건축하거나 철거하는 것도 마찬가지로 비윤리적이라는 주장은 너무 터무니없는 걸까?
상업 예술 작품의 50%가 조만간 AI로 만들어지지는 않을 것임. 대다수 소비자는 구상 단계에서만 AI를 사용해도 싫어하며, 그런 프로젝트를 적극적으로 피할 것임.
이게 정말 쓰라린 교훈의 사례일까? 확산 모델에도 LLM과 같은 규모와 연산량을 투입하면 이 정도 성능이 나오지 않을까?
하필 작업 중인 그림이 보기 흉한 갈색으로 덮인 직후에 들어가 버림. 모델이 남긴 기록도 그림 전체를 망친 붓질을 수습하려는 내용임.
“재앙임. everywhere() 전체에 medium 0.35, coverage 0.8, filbert 26, pressure 0.44로 글레이징을 하니 거대하고 끊어진 벽돌·조약돌 무늬가 그림 전체에 깔림. 미디엄 때문에 물감이 너무 묽어졌고, 붓의 마른 붓질 패턴이 강한 파충류 피부 같은 질감을 만들어 그림을 덮어버림. 되돌려야 함.”
정말 인상적인 동시에 거슬리는 불쾌한 골짜기가 느껴짐. 풍경 대부분에 교회들이 바로 옆으로 다닥다닥 모여 있어 전혀 말이 안 되고, 그것 때문에 그림이 망가짐.
“AI는 별것 아니고 텍스트를 되뇌기만 한다”는 반응이 많은 걸 보면 업계 절반도 흐름에 뒤처진 듯함.
지난 1년 이상 여러 모델이 이미지를 직접 출력할 수 있었고, 주요 모델들은 모두 이미지를 직접 볼 수 있음. 이것이 멀티모달의 의미임. 토큰은 이제 문자 언어보다는 감각 경험의 단위에 더 가까움.
텍스트만 출력하더라도, 텍스트 표현과 최종 형태 사이에 변환 계층만 있으면 텍스트로 표현 가능한 무엇이든 조작할 수 있음. 텍스트 명령도 여기에 포함되므로, 모델의 잠재적 활용 범위는 대략 인간이 하는 모든 일에 해당함.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기