모델이 실제로 성능이 저하되는 것일까, 아니면 단일 샘플에서 과도하게 해석하는 걸까?
요약
LLM의 성능 저하 여부를 판단할 때 단일 샘플에 의존하기보다 통계적 접근이 중요합니다. 특히 공간 추론 능력을 테스트하는 '펠리컨 테스트' 같은 경우, 여러 번 반복 실행하여 평균적인 성능을 측정해야 의미 있는 비교가 가능합니다.
핵심 포인트
- LLM의 성능 저하 판단은 단일 샘플보다는 통계적 분석이 필수입니다.
- 공간 추론 능력 검증을 위해 펠리컨 테스트와 같은 가혹한 프로브 사용이 유효합니다.
- 평가 시에는 완결성, 기하학적 건전성 등 다차원적인 규칙 기반 교차 확인이 필요합니다.
- 테스트 과정에서 발생하는 반복적인 로깅 및 기록 유지 비용 절감을 Folkbench 등을 활용할 수 있습니다.
고지: 저는 이 게시물 말미에 언급할 Folkbench 구축에 참여하고 있습니다.
저는 오랫동안 논의되었지만 결코 명확히 해결되지 않은 질문을 곱씹어 왔습니다. 우리가 모델이 '성능이 저하되었다(got dumber)'거나 '약화되었다(nerfed)'고 말할 때, 그중 실제로 진짜인 부분은 얼마나 되고, 단일 샘플에서 오는 착각에 불과한 부분이 얼마나 될까요?
최근 제가 아는 많은 사람들이 모델에게 펠리컨 테스트(pelican test)를 시도하고 있습니다 (펠리컨이 자전거를 타는 SVG를 그리게 하는 것). 이것은 정말 가혹한 테스트입니다. 단순히 코드를 작성하는 것에 관한 것이 아니라 공간 추론 능력에 관한 것입니다: 부리와 핸들바, 발과 페달, 프레임과 바퀴가 조화롭게 연결되어야 합니다. 만약 모델의 공간적 이해도가 아주 조금이라도 어긋나면, 상당히 추상적인 결과물이 나옵니다.
하지만 수십 번 실행해 본 후, 펠리컨 테스트에서 가장 큰 함정은 단일 출력물로 판단하는 것이라고 생각합니다.
LLM(대규모 언어 모델)은 무작위성이 내재된 확률적 샘플러입니다. 동일한 프롬프트를 사용하더라도, 한 번 실행했을 때는 공간 인지 능력이 최고조에 달해 — 프레임, 크랭크, 발의 위치가 모두 정확합니다. 그런데 나중에 다시 실행하면 갑자기 포스트모던 추상 미술 작품이 됩니다. 만약 Provider A가 20번 중 16번 정도 기본적으로 말이 되는 자세를 보여주고, Provider B가 20번 중 8번만 통과한다면, 그때 그 차이는 통계적으로 의미가 있습니다. 단 하나의 무작위 스크린샷을 근거로
- 펠리칸 점수는 어떻게 매기나요? 순수 인간의 검토는 확장성이 떨어지고; 순수 LLM-as-a-judge 방식은 자체 출력을 과도하게 선호하는 경향이 있습니다. 현재로서는 이를 네 가지 차원 — 펠리칸 (완결성), 자전거 (기하학적 건전성), 라이딩 (새가 자전거에 공간적으로 실제로 연결되는 방식) 및 애니메이션 (움직임과 클리핑) — 으로 분할하여, 비전 심사관(vision judge)과 SVG DOM상의 정적 규칙을 통해 교차 확인해야 할 것 같습니다.
- 테스트 프롬프트의 생애 주기. 어떤 '킬러 프롬프트'가 퍼지기 시작하면, 조만간 훈련 데이터로 스크랩되거나 미세 조정(fine-tuning)의 대상이 됩니다. 장기적으로는 단 하나의 질문에 의존할 수 없으며, 공간적 관계, 지침 준수 및 구조적 추론을 포괄하는 역동적인 탐색 질문(probes) 풀이 필요합니다.
저는 오랫동안 이러한 테스트를 수동으로 진행해 왔는데, 가장 큰 어려움은 기록 유지 비용이었습니다. 반복 실행, SVG 저장, 매개변수 로깅, 타임스탬프 정렬 등 — 몇십 개의 배치만 거치면 무감각해집니다. 시간을 잡아먹는 것은 보통 테스트 자체라기보다는 그 주변의 지루한 로깅과 정리 작업입니다. 그렇다고 해도, 단순히 여러 모델이 어떻게 성능을 내는지 빠르게 읽어보고 싶다면, 모든 것을 직접 할 필요는 없습니다 — Folkbench (https://folkbench.com/?utm_source=luntan&utm_campaign=dev)에 이미 만들어진 리더보드가 있어 수고를 덜어줄 수 있습니다.
만약 여러분도 이 테스트를 진행하고 있다면, 어떻게 수행하는지 듣거나 가장 기괴한(cursed) 결과를 보고 싶습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기