
AI 연구소들은 Pelicanmaxxing을 하고 있는가?
요약
Simon Willison의 '자전거 타는 펠리컨' 프롬프트를 활용해 주요 LLM들이 특정 벤치마크에 최적화(Pelicanmaxxing)되어 있는지 실험한 연구입니다. 7개의 프론티어 모델을 대상으로 1,008개의 SVG 생성 테스트를 진행하여 모델별 성능과 일관성을 분석했습니다.
핵심 포인트
- 특정 유명 프롬프트에 대한 모델의 편향성(Pelicanmaxxing) 가능성 조사
- 7개 프론티어 모델 대상 48개 프롬프트 그리드 실험 수행
- SVG 생성, PNG 렌더링, LLM 판정의 3단계 파이프라인 구축
- 동물과 탈것의 일관성을 기준으로 모델별 성능 비교
지난 몇 년 동안, Simon Willison은 모든 주요 LLM (Large Language Model) 출시 때마다 동일한 프롬프트로 테스트를 진행해 왔습니다: “자전거를 타는 펠리컨의 SVG를 생성해줘”.
농담 삼아 시작된 벤치마크가 AI 분야에서 가장 유명한 비공식 벤치마크 중 하나가 되었습니다. Simon의 '자전거 타는 펠리컨' 결과물은 AI 연구소들의 새로운 출시를 알리는 Hacker News 스레드에서 가장 많은 추천을 받는 댓글 중 하나가 되곤 합니다.
이 벤치마크는 이제 그 유용성과 더불어, AI 연구소들이 이에 대해 'benchmaxxing1'을 하고 있는 것은 아닌지에 대한 논의가 활발할 정도로 유명해졌습니다. 수십억 또는 수조 달러가 걸려 있고, 강력한 결과가 사용자를 설득하는 데 도움이 될 수 있다면, 모델을 약간 'pelicanmaxx' 하고 싶은 유혹을 느끼지 않을 수 있을까요?
저는 이를 확인해보고 싶어서 작은 실험을 준비했습니다. 7개의 프론티어 모델(frontier models)을 대상으로 1,008개의 SVG를 생성했고, LLM 판사(LLM judge)로 점수를 매겼으며, 분석에는 Claude Fable 5를 사용했습니다.
이 글은 그 결과를 제시합니다. 모든 코드는 Github에서 확인할 수 있습니다.
테스트 방법
저는 8종의 동물 × 6종의 탈것 = 48개의 프롬프트 그리드를 구축했으며, 그중 한 칸이 바로 그 유명한 프롬프트입니다:
동물: pelican (펠리컨), flamingo (홍학), heron (왜가리), otter (수달), raccoon (너구리), antelope (영양), whale (고래), cat (고양이)
탈것: bicycle (자전거), unicycle (외발자전거), skateboard (스케이트보드), scooter (스쿠터), plane (비행기), boat (보트)
모든 프롬프트는 동물과 탈것만 바꿨을 뿐, Simon의 프롬프트와 거의 동일한 문구 형식을 사용했습니다. 동물과 탈것의 선택이 매우 엄격한 방식으로 이루어진 것은 아니지만, 원본 프롬프트와의 유사성과 난이도를 모두 변화시키려고 노력했습니다. Flamingo와 heron은 펠리컨과 상당히 유사하며, cat, raccoon, otter는 쉬운 사례이고, antelope는 어렵고, whale은 최대한 다른 사례입니다.
저는 OpenRouter를 통해 7개의 모델을 테스트했습니다: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, 그리고 DeepSeek V4 Pro. 모든 모델에 동일한 추론 노력(reasoning effort)을 요청하며, temperature 1.0 설정으로 프롬프트당 3개의 샘플을 생성했습니다. 그 결과 1,008개의 SVG가 생성되었습니다.
그 후 각 이미지를 3단계 파이프라인을 통해 실행했습니다:
렌더링 (Rendering): 각 SVG는 PNG로 렌더링됩니다. 만약 모델이 SVG를 반환하지 않거나 렌더링에 실패하는 경우, 유효한 결과물이 나올 때까지 다시 생성하며, 이때 시도 횟수를 기록합니다. 1,008개의 생성 과정 동안 재시도는 단 11회뿐이었습니다.
판정 (Judging): GPT-5.6 Luna가 동물, 탈것, 그리고 동작의 일관성(coherence)에 대해 각 이미지에 1~5점 사이의 점수를 부여합니다. 아래에서 동물이나 탈것의 순위를 매길 때는 해당 항목의 점수를 그대로 사용합니다. 이미지당 하나의 숫자가 필요한 경우에는 세 점수의 평균을 사용하며, 이를 판정 점수(judge score)라고 부릅니다.
특징 추출 (Feature extraction): 더 상세한 분석을 위해, 렌더링된 각 이미지를 Gemini 3.1 Flash-Lite에 전달하여 인식된 동물과 탈것, 피사체가 향하는 방향, 그리고 장면 요소(scene elements)에 대한 개방형 목록을 기록했습니다.
저의 가설은 만약 어떤 연구소가 이 벤치마크로 학습되었다면, 펠리컨 행(row)의 점수가 동물이 받아야 할 점수보다 높게 나오거나, 자전거 열(column)의 점수가 탈것이 받아야 할 점수보다 높게 나오거나, 혹은 펠리컨-자전거 특정 셀(cell)이 두 항목 모두를 압도하는 조합 중 하나로 나타날 것이라는 점입니다.
증거 #1: 자전거를 탄 펠리컨들이 딱히 더 좋아 보이지 않는다
점수를 매기기 전, 가장 간단한 테스트는 직접 이미지를 보는 것입니다. 특정 연구소를 선택하여 해당 연구소가 그린 모든 결과물과 각 이미지 아래의 판정 점수를 확인해 보세요 (클릭하면 전체 크기로 열립니다):
[IMG:1]
아래 분석을 실행하기 전에 저도 직접 이미지들을 살펴보았습니다. 눈에 띄는 점은 없었습니다. 펠리컨-자전거 이미지가 해당 모델의 다른 그리드 이미지들보다 눈에 띄게 좋아 보이는 사례를 찾을 수 없었습니다. GLM-5.2의 첫 번째 샘플은 나머지보다 약간 더 나아 보였을 수도 있지만, 해당 배치(batch)에서 스케이트보드를 탄 왜가리(heron)도 꽤 멋지게 생성되었기 때문에 확실하게 말할 수는 없습니다. 그 외에는 각 모델이 그리는 다른 이미지들과 비슷해 보였으며, 자전거를 탄 펠리컨을 잘 그리는 연구소들은 다른 동물-탈것 조합도 잘 그려냈습니다.
하지만 이 테스트는 재현하기 어렵고 사람마다 의견이 다를 수 있습니다. 그래서 저는 더 정량적인(quantitative) 무언가를 원했고, 그것이 바로 위에서 상세히 설명한 방법을 선택한 이유입니다.
증거 #2: 연구소들은 펠리컨을 더 잘 그리지 못한다
다음은 모든 모델을 통합하여 동물별 평균 점수를 나타낸 것입니다:
[IMG:1]
펠리컨은 고양이, 고래, 너구리, 왜가리, 영양에 이어 8종 중 6위를 차지했습니다. 만약 AI 연구소들이 이 벤치마크(benchmark)를 학습하고 있다면, 펠리컨이 상위권에 있어야 합니다. 하지만 펠리컨은 하위권에 머물러 있습니다. 7개 연구소 모두 펠리컨보다 고양이, 고래, 너구리를 더 잘 그립니다.
물론, 단순히 펠리컨이 고양이보다 그리기에 더 어려울 수도 있습니다. 연구소가 펠리컨을 학습하더라도 쉬운 동물들을 뛰어넘지는 못할 수 있으므로, 이 순위만으로는 그 가능성을 배제할 수 없습니다. 난이도에 대한 조정은 증거 #4에서 다루겠습니다.
증거 #3: 연구소들은 자전거를 더 잘 그리지 못한다
자전거의 성적은 훨씬 더 나쁩니다. 자전거는 꼴찌인 비행기와 거의 동률을 이루며 뒤에서 두 번째를 기록했습니다:
[IMG:2]
만약 연구소들이 이 벤치마크를 학습하고 있다면, 자전거가 이 순위의 상위권에 있어야 합니다. 하지만 그렇지 않습니다. 그러나 여기서도 동일한 주의 사항이 적용됩니다. 자전거는 스케이트보드보다 그리기가 더 어렵습니다. 두 개의 일치하는 바퀴, 양쪽 차축에 닿는 프레임, 핸들바, 안장, 그리고 페달이 필요합니다. 심사위원은 자전거 이미지의 2/3에서 이러한 요소 중 하나가 누락되었거나 연결되지 않았음을 지적했습니다. 자전거 이미지를 학습하더라도 더 단순한 탈것들에 비해 뛰어난 결과물을 내지 못할 수 있습니다.
다만, 비행기에 대해 한 가지 언급하자면, 모델들이 종종 이를 기하학적으로 해석하기 때문에 'plane' 대신 'airplane'을 선택했어야 했습니다. 모델들은 항공기를 비행시키는 대신 동물이 평평한 표면 위에 서 있는 모습으로 그렸습니다. 비행기는 특징 추출기(feature extractor)가 차량을 전혀 찾지 못한 유일한 탈것이었으며(다른 5개 탈것은 0건인 반면, 비행기는 168개 이미지 중 25건), 비행기 이미지의 20%가 탈것 점수에서 1점 또는 2점을 받았습니다. 이는 자전거의 5%, 보트·스쿠터·스케이트보드의 0%와 대조적입니다.
증거 #4: 난이도를 조정하더라도 연구소들은 자전거를 탄 펠리컨을 더 잘 그리지 못한다
두 요소를 결합하면 "자전거를 탄 펠리컨"은 48개 중 42위로 순위의 최하단에 위치하게 됩니다:
[IMG:3]
하지만 다시 말하지만, 일부 조합은 다른 조합보다 단순히 그리기가 더 어려울 수 있습니다.
이를 고려하기 위해, 저는 1,008개의 모든 이미지에 대해 다음과 같은 고정 효과 회귀 분석 (fixed-effects regression)을 수행했습니다: score ~ lab + animal × vehicle, 그리고 pelican, bicycle, pelican-bicycle 셀에 대한 연구소별 상호작용 항 (per-lab interaction terms)을 포함하였으며, 강건한 표준 오차 (robust standard errors)를 적용했습니다. animal × vehicle 항은 48개 조합 모두의 내재적인 난이도를 흡수합니다. 상호작용 항은 평균적인 연구소와 비교하여 각 연구소가 특정 벤치마크에서 얻는 향상도를 신뢰 구간 (confidence intervals)과 함께 측정합니다.
결과:
- 모든 연구소별 pelican 효과 (6개 탈것 전체에 걸쳐 pelican에 대한 해당 연구소의 향상도)는 -0.11에서 +0.14 judge points 사이에 위치하며, 유의미한 수준에 근접한 것은 하나도 없습니다 (최소 p = 0.25).
- 연구소별 bicycle 효과 (8개 동물 전체에 걸쳐 bicycle에 대한 해당 연구소의 향상도)는 Grok 4.5의 -0.18 (p=0.11)부터 Gemini 3.5 Flash의 +0.27 (p=0.022)까지 나타납니다. 오직 Gemini만이 p < 0.05를 통과했으며, 양방향으로 7개 항목이 해당됩니다.
- pelican-bicycle 셀 효과 (연구소의 pelican 및 bicycle 효과를 제외하고, 특정 조합에 대해 추가적으로 발생하는 향상도) 중 p < 0.05를 통과하는 것은 없습니다. 가장 큰 양의 효과는 앞서 언급했던 GLM-5.2의 +0.35 (p=0.12)입니다. 이는 이 실험에서 신호 (signal)에 가장 가까운 것이지만, 여전히 우연의 범위 내에 있습니다.
다음은 연구소별 전체 추정치입니다. Pelicanmaxxing을 하는 연구소라면 해당 행 전체에서 점들이 0의 선 오른쪽에 위치할 것입니다:
모든 pelican 구간과 모든 셀 구간에는 0이 포함되어 있습니다. 단 하나만 포함되지 않는데, 바로 bicycle 열의 Gemini 3.5 Flash입니다. 하지만 p < 0.05 기준에서 21번의 테스트를 수행할 경우, 우연만으로도 약 하나의 위양성 (false positive)이 예측되며 (21 × 0.05 ≈ 1.05), 실제로 하나가 나타났습니다. 또한 이는 다중 비교 교정 (multiple-comparisons correction)을 통과하지 못합니다. 21번의 테스트에 대한 Bonferroni 임계값은 0.05/21 ≈ 0.002이며, 해당 항목의 p-value는 0.022입니다. 추정치와 p-value의 전체 표는 리포지토리 (repo)에 있습니다.
하지만 이 구간들은 평균적으로 약 ±0.6 judge points 정도로 넓습니다. 이보다 작은 향상도는 이 테스트로 포착되지 않을 것입니다.
증거 #5: pelican-bicycle 장면은 암기된 것처럼 보이지 않는다
일부에서는 펠리컨이 항상 오른쪽을 향하고 있다거나, 태양 또는 스카프와 같은 요소가 반복된다는 점을 들어, 자전거를 탄 펠리컨 장면이 암기된 구도(memorized composition)처럼 보인다고 제안하기도 했습니다. 그래서 저는 이것이 사실인지 알고 싶었습니다.
방향 (Direction): 7개 연구소 전체에 걸친 21개의 모든 '펠리컨-자전거' 이미지들은 모두 오른쪽을 향하고 있습니다. 다른 어떤 동물/탈것 조합도 이와 같지 않습니다.
하지만 오른쪽을 향하는 것은 흔한 일입니다. 전체 1,008개 이미지의 60%가 그러합니다. 그 빈도는 동물과 탈것에 따라 다르며, 자전거는 이러한 경향이 가장 강하게 나타나는 두 가지 탈것 중 하나입니다:
| 탈것 (vehicle) | 왼쪽 (left) | 오른쪽 (right) | 모호함 (ambiguous) |
|---|---|---|---|
| 스쿠터 (scooter) | 9% | 83% | 8% |
| ... |
펠리컨 또한 오른쪽을 향하는 경향이 있는 동물 중 하나입니다:
| 동물 (animal) | 왼쪽 (left) | 오른쪽 (right) | 모호함 (ambiguous) |
|---|---|---|---|
| 영양 (antelope) | 21% | 78% | 1% |
| ... |
펠리컨이나 자전거를 보는 이를 향하도록 그리는 것은 어렵기 때문에, 모델들은 거의 항상 측면에서 왼쪽이나 오른쪽을 향하도록 그립니다. 이것이 해당 이미지들 중 모호한 경우가 거의 없는 이유입니다. 다른 조합들도 만장일치에 가까운 수치를 보입니다: 스쿠터를 탄 영양과 스쿠터를 탄 펠리컨은 21개 중 20개가, 자전거를 탄 왜가리(heron)는 21개 중 19개가 일치합니다. 따라서 21개 중 21개가 일치한다는 것이 특이치(outlier)처럼 보이지는 않습니다.
장면 요소 (Scene elements): 저는 추출기(extractor)가 이미지에서 발견한 모든 요소를 명명하도록 했습니다. 그 결과는 다음과 같습니다:
암기된 장면이라면 사진이 거듭될수록 동일한 요소 세트가 반복되어 나타날 것입니다. 저는 그것을 찾아보았고, 일부 조합은 매번 동일한 요소를 생성하는 경향이 있다는 것을 발견했습니다. 배에 탄 모든 홍학(flamingo)에는 태양이 포함되어 있습니다. 비행기에 탄 수달(otter)은 38%의 확률로 스카프를 착용합니다. 자전거를 탄 고양이는 38%의 확률로 바구니를 가집니다.
자전거를 탄 펠리컨은 특별히 다른 점이 있는 것 같지 않습니다. 그저 다른 모든 동물-탈것 조합과 마찬가지로, 몇몇 요소가 더 빈번하게 나타날 뿐입니다.
한계점 (Limitations)
단일 LLM 판사(judge)를 사용한 점수 산정. 여기에 제시된 모든 점수는 하나의 모델인 GPT-5.6 Luna가 한 번에 하나의 이미지를 보고 매긴 것입니다. 저는 정렬(alignment) 작업을 많이 수행하지 않았으며, 모델을 재실행했을 때 스스로 얼마나 일관되게 동의하는지도 확인하지 않았습니다. 만약 모델이 그림을 신뢰성 있게 판단할 수 없다면, 위의 수치들은 큰 의미가 없습니다. 또한 판사는 참가자 중 하나인 GPT-5.6 Terra와 동일한 계열의 모델입니다. 하지만 모든 연구소는 48가지 조합을 모두 그리므로, 우연히 특정 연구소의 스타일을 선호하는 판사가 있다면 그 연구소의 그리드 전체를 한꺼번에 끌어올리게 됩니다. 그러나 이 분석은 연구소 내부의 차이(within-lab differences)에만 초점을 맞추고 있으므로 결과가 바뀌지는 않습니다. SVGmaxxing. 전체적으로(또는 탈것 위의 동물과 같은 하위 집합으로서) SVG 생성을 최적화한 연구소는 모든 셀에서 동시에 점수가 상승하여, 단순히 실력이 좋은 연구소와 동일해 보입니다. Google/DeepMind와 같은 일부 연구소는 이를 공개적으로 수행하고 있습니다. 본 실험으로는 이를 감지할 수 없습니다. 제한된 예산. 전체 실험은 약 80달러의 API 크레딧으로 진행되었습니다. 이로 인해 셀당 샘플 3개, 단일 판사, 7개의 모델로 제한되었습니다. 또한
또 다른 눈에 띄는 점은 장면 구성 (scene composition)의 방향성입니다. 21개의 pelican-bicycle 이미지는 모두 오른쪽을 향하고 있는데, 이는 그리드 내에서 모든 이미지가 일치하는 유일한 조합입니다. 하지만 이것이 그리 그리 이상해 보이지는 않습니다. 오른쪽을 향하는 것은 실험 전반에 걸쳐 일반적인 현상입니다. 다른 세 가지 조합도 90% 이상의 일치율을 보였으며, 총 48개의 조합이 있었음을 고려할 때, 그중 하나가 21개 중 21개 모두 일치하는 결과가 나온 것은 놀라운 일이 아닙니다.
더 그럴듯한 이야기는 Google/DeepMind가 하는 것처럼 SVGmaxxing을 하고 있다는 것입니다. 다른 연구소들도 더 조용히 이를 수행하고 있을지 모릅니다. 안타깝게도 이 실험만으로는 누가 이를 수행하고 있는지 말할 수 없습니다. 하지만 적어도 AI 연구소들이 단지 Simon Willison을 속이기 위해 자전거를 탄 펠리컨 테라바이트 분량을 생산하고 있는 것은 아니라는 사실을 알게 되었으니 오늘 밤은 편히 잠들 수 있을 것입니다.
데이터를 직접 확인하고 싶다면, 전체 파이프라인이 리포지토리 (repo)에 있습니다.
각주
popular benchmarks에서 높은 점수를 얻기 위해 AI 모델을 최적화하는 관행.↩︎
인용
@online{castillo2026,
author = {Castillo, Dylan},
title = {Are {AI} Labs Pelicanmaxxing?},
...
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기