
AI 연구소들이 펠리컨 맥싱(pelicanmaxxing)을 하고 있을까?
요약
AI 연구소들이 특정 조합(자전거 타는 펠리컨)을 모델에 의도적으로 학습시키는지 확인하기 위해 수행된 벤치마크 실험 결과입니다. 다양한 모델을 대상으로 테스트한 결과, 특정 조합에 대한 편향이나 의도적인 학습 증거는 발견되지 않았습니다.
핵심 포인트
- 8종의 동물과 6종의 탈것을 조합한 48개 프롬프트로 실험 수행
- GPT-5.6, Claude Sonnet 5 등 최신 모델 7종 대상 테스트
- 특정 조합(펠리컨+자전거)에 대한 의도적 학습 증거 없음
- GLM-5.2 모델이 해당 조합에서 미세한 성능 상승을 보였으나 유의미하지 않음
2026년 7월 22일 - 링크 블로그
AI 연구소들이 펠리컨 맥싱(pelicanmaxxing)을 하고 있을까? (via) Dylan Castillo의 훌륭한 작업물입니다. 그는 저의 매우 비과학적인 벤치마크(benchmark)에 대응하여, AI 연구소들이 자전거를 타는 펠리컨을 그리도록 모델을 의도적으로 학습시키고 있는지에 대한 자주 제기되는 질문을 심층적으로 조사했습니다.
저는 과거에 다른 종류의 탈것을 타는 다른 동물들을 대상으로 모델을 테스트하며 무작위로 점검해 왔지만, Dylan의 방법론만큼 철저하게 수행한 적은 없었습니다.
Dylan은 8종의 동물 × 6종의 탈것 = 48개의 프롬프트(prompts)를 구성하여 7개의 서로 다른 모델(GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, DeepSeek V4 Pro)을 통해 각각 세 번씩 실행했습니다. 그런 다음 GPT-5.6 Luna와 Gemini 3.1 Flash-Lite를 사용하여 결과를 평가하는 데 도움을 받았습니다.
결과를 탐색하기 위한 깔끔한 필터 뷰가 있습니다:

그가 테스트한 모델들에서 펠리컨 맥싱(pelimaxxing)의 증거는 발견되지 않았습니다:
- 자전거를 타는 펠리컨이 더 나아 보이지 않음
- 연구소들이 펠리컨을 더 잘 그리지는 못함
- 연구소들이 자전거를 더 잘 그리지는 못함
- 난이도를 조정한 후에도 연구소들이 자전거를 타는 펠리컨을 더 잘 그리지는 못함
- 펠리컨-자전거 장면이 암기된 것처럼 보이지 않음 [...]
펠리컨은 다른 동물보다 더 잘 그려지지 않았습니다. 자전거는 다른 탈것보다 더 잘 그려지지 않았습니다. 그리고 어떤 연구소도 이미 펠리컨과 자전거가 예측하는 조합보다 더 잘 그려내지 못했습니다. GLM-5.2가 가장 근접했습니다. 이 모델은 정확히 펠리컨-자전거 셀(cell)에서 가장 큰 상승을 보였으며, 첫 번째 자전거 타는 펠리컨 샘플이 제 눈길을 끌었습니다. 하지만 그 효과는 작고 유의미하지 않으므로, 너무 큰 비중을 두지는 않겠습니다.
최근 기사
- Claude Code 팀의 Cat 및 Thariq와의 파이어사이드 챗 (Fireside Chat) - 2026년 7월 21일
- Kimi K3, 그리고 펠리컨 벤치마크에서 우리가 여전히 배울 수 있는 것 - 2026년 7월 16일
- 새로운 GPT-5.6 제품군: Luna, Terra, Sol - 2026년 7월 9일
AI 자동 생성 콘텐츠
본 콘텐츠는 RSS: Simon Willison's Weblog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기