세 가지 모델이 한국어 경품 벤치마크에서 만점을 기록하다
요약
작성자가 한국어 경품 공지문에서 현금 상금을 정확히 추출하는 벤치마크를 설계하고, Gemini 3.7 Flash, Gemma 4 26B A4B, GPT-5.4 nano 세 모델을 테스트했습니다. 이들은 명확한 지침 하에서는 모두 완벽하게 작동했지만, 실제 복잡한 콘테스트 페이지 처리 능력은 아직 검증되지 않았습니다.
핵심 포인트
- 한국어 경품 공지문에서 현금 상금을 추출하는 벤치마크를 개발함.
- Gemini 3.7 Flash 등 주요 모델들이 명시적 지침을 따르는 능력을 입증함.
- 현재 테스트는 '천장 효과'가 있어, 실제 복잡한 환경에서의 성능은 추가 검증이 필요함.
이 글은 Kaggle 벤치마킹 챌린지에 제출하는 내용입니다.
무엇을 벤치마크했는가
저는 콘테스트 발견 과정에서 발생하는 사소한 오류, 즉 한국어 경품 공지를 읽고 헤드라인 상금 풀이나 상품권 자체를 대상 또는 1등 현금상으로 오인하여 보고하는 경우를 테스트하고 싶었습니다. "총 상금: 1천만 원"이라고 명시된 콘테스트 목록이 실제로는 우승자에게 300만 원만 지급할 수도 있습니다.
저는 수작업 검토가 완료된 독창적인 합성 한국어 공지문 10개를 작성했습니다. 이 과제는 각 모델에게 전체 우승팀을 위한 대상 또는 1등의 KRW 현금 금액만을 반환하도록 요청합니다. 해당 상이 현금이 아니거나 미공개인 경우 0을 반환해야 합니다. 테스트 케이스에는 만 단위 및 억 단위 표기, 쉼표, 주의를 분산시키는 부상, 상품권, 미확인 금액, 팀 지급액 등이 포함됩니다. 정확한 정수 일치 시 1점을 얻으며, 보고된 점수는 정답 비율입니다. 이 테스트에는 개인 데이터나 크롤링된 콘테스트 공지는 없습니다.
테스트된 모델
저는 동일한 Kaggle 과제를 Gemini 3.7 Flash, Gemma 4 26B A4B, 그리고 GPT-5.4 nano에 대해 실행했습니다. 저는 광범위하게 사용되는 호스팅형 모델, 오픈 소스 모델, 그리고 작은 규모의 호스팅형 모델을 혼합하여 테스트하고 싶었습니다. 각 모델은 동일한 10가지 케이스와 채점 코드를 접했습니다.
결과
| 모델 | 정확히 일치하는 개수 | 점수 |
|---|---|---|
| Gemini 3.7 Flash | 10/10 | 1.00 |
| ... |
이 결과는 순위라기보다는 테스트에 대한 경고로 저를 더 놀라게 했습니다: 세 모델 모두 완벽한 점수를 받았다고 해서 이들을 구별할 수는 없습니다. 이 케이스들은 세 모델 모두가 깨끗하고 짧은 공지문에서 명시적인 지침을 따르고 있음을 확인시켜 줍니다. 하지만 어떤 모델도 실제 콘테스트 페이지를 어떻게 처리하는지는 보여주지 못합니다.
0으로 답해야 하는 케이스는 유용한 점검 사항입니다: "50만 원 상당의 여행 상품권"이 현금 500,000 KRW로 간주되어서는 안 되며, 총 상금 풀에서 첫 번째 등급 금액을 추론해서도 안 됩니다. 세 모델 모두 이 케이스들을 정확하게 처리했습니다. 또한 팀 예시에서는 개인별 분배가 아닌 전체 팀의 상금을 요구하는데, 세 모델 모두 1,000,000 KRW를 반환했습니다.
다음으로 무엇을 측정할까요? 경품 표와 각주가 있는 더 긴 공지문, OCR 오류, 혼합 통화, 범위 및 조건부 수상 내역, 그리고 답변이 하나의 문구에만 묶이지 않도록 동일 출처의 패러프레이징(paraphrases)까지 포함해야 합니다. 저는 명확한 재사용 권리가 있는 검토된 실제 공지문만을 추가할 것입니다. 또한 정확도와 함께 오류 유형을 보고할 것입니다: 잘못된 수상 레벨, 단위 변환, 비현금성 혼동, 그리고 지원되지 않는 추론(unsupported inference)입니다.
이 첫 번째 버전은 작고 투명한 탐색적 검사(probe)입니다. 가장 강력한 발견점은 천장 효과(ceiling effect)이며, 더 어려운 후속 연구를 위한 재현 가능한 기준선(baseline)을 제공합니다. Codex가 노트북 구축 및 실행에 도움을 주었으며, 사례, 코드, 평가 내용은 검토용으로 공개되어 있습니다.
저의 벤치마크
Kaggle의 한국어 공모전 경품 읽기 리더보드. 태스크와 연결된 노트북에서는 모든 프롬프트, 예상 정수(expected integer), 채점 규칙 및 실행 내역을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기