AI 연구소들은 ‘자전거 타는 펠리컨’에 맞춰 모델을 최적화했을까?
요약
AI 모델의 SVG 생성 능력을 평가하며 특정 벤치마크(자전거 타는 펠리컨)에 대한 모델의 최적화 여부와 한계를 분석합니다. 단순 벤치마크 통과를 넘어 장면 구조에 대한 진정한 이해와 범용적인 SVG 생성 능력이 필요함을 강조합니다.
핵심 포인트
- 특정 벤치마크 시나리오에 대한 모델의 하드코딩된 최적화 가능성 검토
- SVG 생성은 단순 이미지 생성을 넘어 공간 지식과 프로그래밍 능력을 요구함
- 현재 LLM은 이미지의 구조적 이해를 바탕으로 한 벡터 경로 생성에 취약함
- 벤치마크 최적화 문제 해결을 위해 더 나은 평가 파이프라인 구축이 필요함
다른 동물과 탈것 조합도 틈틈이 확인해 봤는데, 특정 AI 연구소가 유독 자전거 탄 펠리컨만 잘 그린다는 증거를 찾는 게 꿈이었음
Dylan이 8×6개 조합으로 SVG 1,008개를 생성한 방법론은 내가 생각했던 것보다 훨씬 탄탄함. 하지만 어떤 모델에서도 자전거 탄 펠리컨이 다른 조합보다 눈에 띄게 잘 나온 경우는 찾지 못했음
펠리컨에만 최적화한 게 아니라 SVG 전반에 최적화했을 수도 있음. 복잡한 SVG 생성은 범용 프로그래밍 및 공간 지식을 시험할 수 있어 처음에는 좋은 벤치마크였지만, 이 과제만 직접 공략한다면 그리 어렵지 않음
SQL 벤치마크를 만든 TPC에서도 비슷한 일이 있었음. TPC 성능이 나쁘면 경쟁 자격이 없고, 좋으면 고객의 실제 과제를 다루는 비교 평가에 참가할 자격을 얻는 구조였음
혼잡한 시장에서는 벤치마크 통과가 입장료지만, 특정 장면만 하드코딩하고 인접 문제를 개선하지 않는 식의 좁은 최적화는 곤란함. GPU 분야의 ATI 카드용 “Quack3” 벤치마크가 떠오름
더 근본적인 시험은 SVG 그림 생성 전반을 평가하는 것임. 임의의 이미지에 설명을 붙이고, LLM에 SVG 생성을 요청한 뒤 래스터화해 결정론적 시각 유사도로 비교하거나 다른 LLM이 원본과의 유사도를 채점하는 파이프라인을 만들 수 있음
새 종류도 바꿔볼 만함. 펠리컨과 같은 사다새목인 넓적부리황새나 왜가리도 후보가 될 수 있음
자전거 탄 펠리컨이 오른쪽을 보는 건 자연스러움. 자전거의 구동계가 오른쪽에 있어 프레임에 가리지 않고 보여주려면 오른쪽 측면을 그리게 되며, 학습 데이터에도 이런 구도가 반영됐을 가능성이 큼
근거: https://www.rei.com/c/bikes
자세히 보면 동물의 방향과 무관하게 모든 자전거가 오른쪽을 향하며, 고래를 제외한 탑승자의 두 다리도 모두 자전거 오른쪽에 놓여 있음. 이는 자전거 작동 방식에 대한 실질적 이해가 크게 부족함을 시사함
더 완곡한 가능성도 있음. 예전에는 자전거 탄 펠리컨 삽화가 거의 없었지만, 이제 실력 있는 작가들이 직접 그린 자료가 생겼고 연구소가 다른 웹 자료처럼 이를 수집하면서 성능이 좋아질 수 있음
이번 결과는 아직 그런 개선도 일어나지 않았음을 보여줌. 오히려 온라인의 나쁜 결과를 학습해 성능이 저하됐을 가능성도 있음
적은 수의 동물·탈것 조합으로 일반화한 결과만으로는, 해당 자료를 직접 또는 광범위하게 학습하지 않았다는 강한 증거가 되기 어려움
더 그럴듯한 설명이 SVG 최적화라면, 여기서 “최적화”가 무엇을 뜻하는지도 따져봐야 함. SVG를 더 잘 그리는 능력 자체는 유용한 기술임
AI 연구소가 기술을 극대화한다는 게 끔찍할 일은 아님. 벤치마크는 현재 모델을 정량 비교할 수 있는 사실상 유일한 수단이므로, 벤치마크 최적화가 불만이라면 더 나은 벤치마크를 만드는 데 기여하는 편이 좋음
LLM으로 SVG를 만들게 하는 일은 인간 화가에게 좌표 목록을 읊어주며 그림을 그리게 하는 것과 비슷해 매우 어렵고 부자연스러움. 요즘 이미지 생성 모델은 구조가 완벽한 자전거와 사실적인 펠리컨을 쉽게 만들지만 결과는 래스터 이미지일 뿐임
이미지를 SVG 경로나 붓질 명령으로 분해해 재현하는 단계가 빠져 있으며, 이를 제대로 하려면 장면 구조에 대한 진정한 이해가 필요하지만 AI는 아직 여기에 약함
뛰어난 인간 화가는 머릿속에서 그리는 과정을 시각화할 수 있고, 이는 LLM이 내부에서 SVG를 구성하는 것과 크게 다르지 않을 수 있음. Anthropic은 최근 이 내부 공간을 workspace라고 표현했으며, SVG에 익숙하지 않은 인간에게만 낯설게 느껴질 가능성이 있음
이 시험은 래스터가 아니라 SVG 생성 자체를 평가하는 것임
Image2처럼 텍스트 출력을 지원하는 이미지 모델이나 Claude처럼 이미지를 읽는 범용 텍스트 모델은 래스터 이미지를 벡터화할 수 있음. 하지만 품질은 아직 낮아서 비전문가가 Inkscape로 수작업한 결과가 더 나음
LLM 출력을 채점하는 방법으로 알려진 순간부터 자금 결정권자와 연구소가 해당 지표에 관심을 두고 교정하기 시작함. 최선의 경우 SVG 역량 전반을 개선하면서 펠리컨 생성도 함께 최적화하겠지만, 이미 알려진 척도가 된 이상 신뢰할 만한 독립 평가로 쓰기 어려워짐
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기