LLM이 데이터 과학 퀴즈를 통과한 후 다른 조언을 제공하다: 측정된 36가지 판단 사례에 대한 Kaggle 벤치마크
요약
본 글은 Kaggle의 표(tabular) 데이터 대회에서 발생하는 '판단적 판단' 능력을 측정하기 위한 벤치마크를 소개합니다. LLM들이 단순 지식 기반 답변을 넘어, 실제 데이터 과학자가 직면하는 미묘하고 측정 가능한 상황별 판단 능력까지 평가받는 새로운 방식을 제시합니다.
핵심 포인트
- LLM의 성능은 모델 아키텍처보다 '판단적 판단' 능력이 중요함.
- 36가지 측정 사례를 통해 LLM의 실제 데이터 과학 지식과 추론 능력을 검증함.
- Gemini 3.1 Pro, Gemma 4 등 여러 최신 모델들이 테스트에 참여하여 성능을 비교함.
- 일부 주제(T02, T07, T03)에서는 모든 모델이 실패하는 난이도 높은 영역이 존재함을 확인했습니다.
본 글은 Kaggle Benchmarking Challenge 제출물입니다.
제가 벤치마킹한 내용
저는 Kaggle의 표(tabular) 대회에서 많은 시간을 보냈고, 저에게 가장 큰 손실을 안겨준 결정들은 모델 아키텍처에 관한 것이 아니었습니다. 그것들은 '판단적 판단(judgment calls)'이었습니다: 이 +0.0001이라는 수치가 정말인가? 원본 데이터셋을 추가해야 하는가? 마지막 날 어떤 두 개의 제출물을 선택할 것인가? (한번에는 플랫폼의 자동 선택 기능을 사용해봤는데, 좋은 성적을 거둘 만했던 진지한 시도가 3,575개 중 708위에 머물렀습니다.)
그래서 저는 모든 답변이 교과서에서 가져온 것이 아니라 측정된(measured) 방식으로 평가되는 벤치마크를 만들었습니다. 각 사례는 Kaggle Playground S6E9 및 S6E10 (2026년 9월–10월)에서 제가 올바른 판단을 내린 짧은 경쟁 상황이거나, 지표에 대한 수학적 사실입니다.
12개 주제 × 3가지 수치 변형 = 36가지 사례:
| # | 주제 | 측정된 내용 |
|---|---|---|
| T01 | n이 클 때의 p-값 | 21개 중 19개 특성이 p < 1e-300이었지만, 단변량 AUC는 0.840 → 0.506 범위에 분포함 |
| ... | ||
| 여기에 동일한 36가지 상황에 대한 두 가지 과제가 있습니다. 각 과제는 '36개 중 몇 개의 사례를 올바르게 맞혔는지'로 점수가 매겨집니다: |
ds-judgment(인식/recognise): 네 가지 선택지 중 하나입니다. 하나는 측정된 답변이고, 다른 하나는 전형적인 함정(classic trap) (제 측정 결과와 모순되는 경험적 규칙), 그리고 나머지 두 개는 그럴듯한 오답입니다. 정답 문자는 A–D 중에서 9번씩 균등하게 배분되어 있으며, 선택지 길이도 일치시키기 때문에
- Google: Gemini 3.1 Pro, 3.8 Flash, 3.7 Flash, 3.5 Flash-Lite; Gemma 4 31B and 26B-A4B (open weights)
- Anthropic: Claude Sonnet 5.5, Haiku 4.5
- OpenAI: GPT-6.1 Sol
- xAI: Grok 4.20 Reasoning
- DeepSeek: R1-0528
- Alibaba: Qwen3-235B-A22B Instruct
일부 모델은 통과하지 못했고, 저는 조용히 그들을 제외하기보다는 그렇게 말하는 편이 낫다고 생각합니다. Grok 4.6은 프록시에서 '모델을 찾을 수 없음(model not found)' 오류를 반환했습니다. GPT-5.5와 gpt-oss-120b는 최악의 경우 비용 예약액이 제 일일 할당량을 초과했기 때문에 오류가 발생했습니다. Claude Opus 5.5는 과제에 대한 초기 버전을 완료했지만, 최종 버전으로 재실행할 여유가 없어 리더보드에는 없습니다.
Kaggle Benchmarks를 활용하여 구축하는 모든 사람들을 위한 실용적인 참고 사항: 제 첫 번째 버전은 사례별(per case)로 통과/실패 여부를 반환했고, 그 결과 벤치마크 리더보드는 모든 모델을
2. 모든 모델이 실패하는 네 가지 주제 클러스터
완전한 개방형 실행을 거친 11개 모델에 대한 주제별 개방형 정확도:
| 주제 | 개방형 정확도 |
|---|---|
| T02 Pearson vs Spearman with 91% zeros | 0.00 |
| ... | |
| Seven topics are essentially solved. Four are failed by nearly everyone. Three of those (T02, T07, T03) are genuine misses, and they are exactly the situations where the textbook rule and the measured answer disagree. The fourth, T11, turned out to be mostly my grading being too strict, which I explain below. |
3. 함정에 빠지지 않지만, 이유를 잘못 파악하다
저는 모델들이 자유 형식(free text)으로 답변할 때 고전적인 경험칙을 선택할 것이라고 예상했습니다. 하지만 그렇지 않았습니다. 122개의 개방형 실패 사례 중 0개가 함정 위치로 판단되었습니다. 거의 모든 경우(단 하나 제외)는 E: 네 가지 위치 중 어느 것과도 일치하지 않는 권장 사항이었습니다. 기록을 읽어보면, E는 보통 잘못된 이유로 올바른 조치를 취하는 것을 의미합니다:
- T07 (더 많은 폴드). 모델들은
합리적인 조언이지만, 이 수치들이 보여주는 요점을 놓치고 있습니다: 0은 평가 점수가 아니라 "와이파이를 사용하지 않음"을 나타내는 코드입니다.
- T05 (CV 대 리더보드). 실패한 두 모델은 정반대의 방향으로 나아갔습니다. Haiku는 교차 검증(cross-validation) 결과에 리더보드의 표준 오차를 적용하는 것이 "+0.00005"가 "노이즈 범위 내"라는 이유로 변화 자체를 거부했습니다. GPT-6.1 Sol은 제 답안지에서 인정하지 않는 지점을 제시했습니다: 0.0003이라는 수치는 단일 점수의 오차이며, 두 개의 상관관계가 있는 제출물 간의 차이는 훨씬 더 정밀할 수 있다는 것입니다. 이는 정확하며, 논란의 여지가 있지만 제 답변보다 나은 답이라고 할 수 있습니다.
제 벤치마크가 잘못된 부분: T11 (최종 선택). 제가 "정답"이라고 생각했던 옵션은 *"P를 선택하고 또 다른 CV 검증 후보를 선택"*이었습니다. 저는 25개의 개방형 T11 실패 사례들을 수동으로 분류했습니다:
| 모델이 추천한 내용 | 건수 | 틀렸다고 할 수 있을까? |
|---|---|---|
| P만 선택하거나, P를 두 번 선택 | 10 | 아니요: 이는 CV를 신뢰하고 수동으로 선택하는 것이며, 측정된 답변의 핵심입니다. |
| ... |
따라서 대부분의 T11 "실패" 사례는 모델이 틀린 것이 아니라 제 답안지가 너무 협소했기 때문입니다. 더 느슨한 기준을 적용하면 T11 점수는 0.24에서 약 0.7로 움직입니다. 저는 답변들을 본 후 재채점하기보다는 현재 발표된 점수를 그대로 유지하고, 이 자리에서 그 사실을 밝히겠습니다. T11의 진정한 신호는 4개의 자동 선택 답변에 있습니다.
제가 얻은 교훈: 친숙한 휴리스틱(heuristic)과 실제 측정이 불일치하는 판단 질문의 경우, 오늘날의 모델들은 보통 방어 가능한 행동을 취하지만, 그 이유를 재구성할 수는 없습니다. 다음 상황이 약간 다를 때 필요한 부분이 바로 이 부분입니다.
한계점
- 심사위원(judge)은 단일 모델(Gemini 3.8 Flash)이므로, 자체 계열의 표현을 선호할 수 있습니다. 저는 E 판결에 대한 샘플을 직접 감사(hand-audited)했으며, 올바른 행동이지만 이유가 틀린 경우를 포함하여 공정하다고 판단했습니다. 하지만 두 번째 심사위원이 더 좋을 것입니다.
- 두 주제는 답안지(answer keys)가 너무 엄격합니다(T11은 위와 같고, T05의 경우 GPT-6.1의 반론이 타당합니다). 공정한 해결책은 CV로 검증된 후보를 포함하는 모든 수동 선택을 허용하고, 쌍별 차이 논거에 점수를 부여하는 것입니다.
- 36개 사례는 적습니다: 한 사례가 약 2.8점이기 때문에, 모델 간의 1~2개 사례 차이는 과도하게 해석해서는 안 됩니다.
- 정답(Ground truth)은 두 개의 Playground 대회에서 나왔습니다. 메커니즘 (순위 기반 AUC, 동률 희석 스피어만 상관계수, 폴드 학습 크기 효과)은 일반적이지만, 구체적인 수치는 그렇지 않습니다.
제가 다음에 측정할 것들
- 다른 계열의 두 번째 심사위원과 그 합의 통계(agreement statistics).
- '행동(action)' 점수와 분리된 '이유(reason)' 점수, 왜냐하면 실패가 발생하는 곳이 바로 그곳이기 때문입니다.
- 모델에게 단순히 _"여기서는 일반적인 휴리스틱이 틀릴 수 있다"_고 알려주는 것만으로 격차를 좁힐 수 있는지 여부. 만약 그렇다면, 지식은 이미 존재하며 단지 기본 설정(default)만이 잘못된 것입니다.
저의 벤치마크
- 벤치마크: https://www.kaggle.com/benchmarks/starkhushi/right-answer-wrong-reason-ml-judgment-calls
- Task 1, 객관식: https://www.kaggle.com/benchmarks/tasks/starkhushi/ds-judgment/5
- Task 2, 주관식 + 심사위원: https://www.kaggle.com/benchmarks/tasks/starkhushi/ds-judgment-open/4
모든 사례의 프롬프트, 옵션, 측정된 답변 및 전체 모델 기록은 태스크 노트북과 실행 로그에 있으므로, 누구나 직접 판결을 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기