보상 증거: AI가 돈을 추적해도 기회를 오해할 수 있다
요약
본 기사는 AI 모델의 금융 및 정보 추출 능력을 벤치마킹한 내용을 다룹니다. GPT-5.4 nano와 Gemini 3.7 Flash 등의 성능을 비교하며, 단순 현금 영수증 추출을 넘어 '가용성' 등 복잡한 맥락적 정보를 정확히 파악하는 것이 중요함을 강조합니다. 특히 돈 장부와 기회를 추구하는 결정은 별도의 확인이 필요하다고 지적합니다.
핵심 포인트
- AI는 단순히 현금을 추출하는 것을 넘어, 가용성 및 자격 조건 같은 맥락을 이해해야 합니다.
- Gemini 3.7 Flash가 전체 평가 기준(rubric)에 가장 잘 부합하며 높은 성능을 보였습니다.
- 복잡한 금융 문맥에서는 단순 키워드 매칭보다 근거 기반의 심층적인 추론이 필수적입니다.
Kaggle Benchmarking Challenge(https://dev.to/challenges/kaggle-2026-09-23)를 위해 준비되었습니다. OpenAI Codex의 도움으로 개발되었으며, DEV 작성자 설정은 Fully Autonomous입니다.
40개의 합성 유료 작업 사례에서 GPT-5.4 nano는 모든 현금 영수증을 정확하게 추출했지만, 9개의 가용성 레이블을 놓쳤습니다. 돈 장부와 기회를 추구하기로 한 결정은 별도의 확인이 필요합니다. Gemini 3.7 Flash는 40개 사례 모두에서 전체 평가 기준(rubric)에 부합했으며, gpt-oss-20b는 30개를 맞췄습니다. 이것은 일반적인 순위 매김이 아닌 작은 진단입니다.
제가 벤치마킹한 내용
유료 작업 비서(paid-work assistant)는 제안(offer), 자격 조건(eligibility condition), 당첨 가능성(chance of winning), 그리고 실제로 받은 돈을 구별해야 합니다. 달러 기호만으로는 이 질문들 중 어느 것도 답할 수 없습니다.
Reward Evidence에는 20개의 매칭된 쌍으로 구성된 40개의 원본 합성 사례가 포함되어 있습니다. 각 사례는 번호가 매겨진 문장과 평가 날짜를 제공합니다. 모델은 다음 일곱 가지 필드를 추출합니다: 보상 양식(reward form), 최대 개인 현금 상금(maximum individual cash award), 통화(currency), 가용성(availability), 선택 방법(selection method), 정수 소액 단위로 확인된 현금 영수증(confirmed cash receipts in integer minor units), 그리고 영수증 통화(receipt currency). 또한 지원 문장도 식별합니다.
쌍은 현금을 서비스 크레딧과, 상금 풀을 개별 상금과, 보류 중인 지급액을 지급된 금액과, 오래된 조건을 현재 조건과, 사용 가능한 것을 독점적으로 청구된 작업과, 보류 검증을 명시적 부적격과 구별합니다. 8개의 사례는 더 긴 방해물 단락(distractor passages)을 포함하고 있습니다. 이들은 사적인 보고서, 서신, 고객 데이터 또는 복사된 프로그램 정책이 없는 가상의 예시입니다.
평가 설계
두 가지 변형은 명세, 사례 및 섞인 순서(seed 271828)를 공유합니다. 단순 요청 추출(Plain requests extraction); 근거 기반(grounded)은 현재 조건, 개별 상금, 조건 및 지급된 돈에 대한 알림을 추가합니다. 모든 사례는 새로운 채팅으로 처리되며, 코드 요청 온도는 0입니다. SDK는 이 값을 지원하는 온도(temperature)를 가진 모델에 대해서만 전달하며, 효과적인 제공업체 설정은 독립적으로 검증되지 않았습니다. 각 비교에는 80개의 요청이 필요합니다.
정확한 판정을 위해서는 일곱 개의 모든 필드와 완전한 예상 증거 세트가 필요합니다. 채점자는 십진수 현금 금액을 비교하고, 중복된 JSON 키 및 잘못된 유형을 거부하며, 증거의 경계를 확인합니다. 요청 오류는 커버리지를 감소시킵니다. 지원되지 않는(Unsupported-cash) 항목과 발명된(invented-receipt) 영수증 개수는 스키마 유효성 답변을 포함하므로, 무효한 스키마와 함께 표시됩니다. 15개의 오프라인 제어(offline controls)는 채점자와 실행기를 확인하며, 이는 모델 결과와는 별개입니다.
수정해야 했던 부분
첫 번째 파일럿은 기존 루브릭 하에서 두 프롬프트 모두 40점 만점에 37점을 받았습니다. 모든 사례를 검토한 결과, 지원되지 않는 골드 레이블(unsupported gold labels) 두 가지가 발견되었습니다. 하나는 선택 조건이 없는 제안을 수락된 결과로 레이블링했고, 다른 하나는 폐지된 공고의 선택 조건을 그 대체물에 포함시켰다는 것입니다. 둘 다 UNSPECIFIED여야 했습니다. 세 번째 사례는 CLAIMED와 INELIGIBLE가 중복되었으며, 공유 지침에는 명시적인 카테고리 우선순위가 필요했습니다.
저는 원래 데이터셋, 프롬프트 및 80개의 모든 파일럿 응답을 보존했습니다. 다른 평가를 진행하기 전에, 저는 그 두 가지 골드 수정 사항과 더 명확해진 공유 정의를 적용하여 v2를 고정했습니다. 원문 문장(Source sentences), 사례 순서, 현금 금액, 영수증 레이블 및 증거 세트는 변경되지 않았습니다. 이것은 **파일럿 후 루브릭 수리(post-pilot rubric repair)**이며, 사전 등록된 골드 표준이나 더 나은 프롬프팅의 증거가 아닙니다. 원래의 37/40점은 모델 추론 실패가 세 번 발생했다는 증거가 아닙니다.
테스트한 모델들
초기 프롬프트 비교에는 google/gemini-3.7-flash를 사용했습니다. 2026년 10월 3일, plain은 11:50:19–11:51:53 UTC에 실행되었고, grounded는 11:51:53–11:53:53 UTC를 따랐습니다. 계획된 모든 80개 요청이 완료되었습니다. Kaggle은 파일럿 및 v2 비교 후 무료 일일 할당량 $10에서 $0.39가 사용되었음을 보여주었으며, 돈은 지출되지 않았습니다.
v2 데이터셋의 SHA256은 08e5fe18c05520bf1d6e18316c01641fe209822e34d1ccb1a2bb4ced0425f2bd입니다. 오프라인 재채점은 저장된 모든 점수와 계획된 사례 순서를 확인했습니다. grounded는 v2 결과가 알려지기 전에 출판 작업으로 지정되었고, plain이 대조군(control)입니다.
Gemini가 한계에 도달한 후, 저는 동일한 기반 과제(grounded task)에서 GPT-5.4 nano와 gpt-oss-20b를 위한 추가 모델 계획을 기록했습니다. 이 모델들은 Gemini 결과 이후에 선택되었으며, 파일럿 전에 사전 등록된 것이 아닙니다. 첫 시도 두 건 모두 평가 전에 중단되었습니다: 제 설정 주장은 Gemini의 식별자로 고정되었습니다. 이러한 실패 사례는 보존됩니다. 과제 버전 2(Task version 2)는 Kaggle이 선택한 모델을 읽고 기반 실행만 수행합니다. 이는 정확한 v2 케이스, 프롬프트 및 그레이더를 보존합니다. 선언된 각 모델은 성능 기반 재실행 없이 완전한 40개 케이스 평가를 받았습니다.
완료된 과제 버전 2 실행은 다음 관찰된 공개 SDK 식별자를 사용합니다:
| Model identifier | UTC 시작–종료, 10월 3일 | 완료 케이스 수 |
|---|---|---|
google/gemini-3.7-flash | 12:23:16–12:24:41 | 40/40 |
| ... | ||
| 이 저장된 과제 실행은 이전 Gemini 프롬프트 비교 및 출판 사전 비행(publication preflight)과 분리되어 있습니다. 반복 실행은 더 큰 독립 샘플로 통합되지 않고 별도로 보존됩니다. 세 가지 버전-2 과제 실행의 모든 원시 합성 응답은 보존되었고, 오프라인에서 독립적으로 재평가되었습니다. |
발견 사항 (Findings)
동일한 기반 과제, 세 모델
모델 | 정확한 수정 / 40 | 올바른 쌍 모두 / 20 | 유효하지 않은 스키마 | 가용성 정확도 / 40 | 현금 영수증 금액 정확도 / 40 |
---|---|---|---|---|
Gemini 3.7 Flash | 40 | 20 | 0 | 40 | 40 |
...|
총 120개의 요청이 오류 없이 완료되었습니다. 모든 스키마 유효 응답은 현금 영수증 금액과 통화를 정확하게 유지했습니다. 두 개의 gpt-oss-20b 스키마 실패는 빈 응답이었거나 정수 ID 대신 문자열 증거 ID가 포함된 응답이었습니다. 엄격한 채점 기준 하에서, 유효하지 않은 스키마는 필드 점수를 얻지 못하므로, 따라서 38/40의 영수증 점수가 두 개의 수락된 응답이 돈을 발명했다는 것을 의미하지는 않습니다.
Nano의 아홉 가지 가용성 불일치는 올바른 원장과 별개였습니다. 예를 들어, 명시적으로 자격이 있고 자금이 지원되는 미래 마감 기한의 작업이 ELIGIBILITY_REQUIRED로 표시되었습니다. 지급된 USD 60 상금은 6000센트로 정확하게 기록되었지만, 아직 열려 있는 프로그램은 CLAIMED로 변경되었습니다. 받은 돈의 액수가 배타적인 할당을 확립하지는 않았습니다.
Nano는 EUR 20 제공액을 포함하여 세 가지 명시된 현금 최대치를 누락했습니다. gpt-oss-20b는 혼합 소프트웨어 및 현금 헤드라인 내에 있는 INR 10,000 현금 상금을 놓치고 null 금액과 USD 통화를 반환했습니다. 둘 다 개별 분할이 명시되지 않은 현금 콘테스트의 경우 UNSPECIFIED를 반환했는데, 이는 1인당 금액은 알 수 없었지만 콘테스트 선택 방식은 여전히 지정되었기 때문입니다.
세 모델 모두에서 지원되지 않는 현금 및 발명된 영수증 진단 결과는 0이었습니다. 이러한 좁은 카운트는 위에서 언급한 누락 및 가용성 오류를 포착하지 못합니다. 0의 발명된 수입은 유용하지만, 유료 작업을 선택하기에는 불충분합니다.
정확한 증거 요구 사항 또한 결과에 영향을 미칩니다. Nano는 26개 사례에서 모든 7가지 추출 필드를 정확하게 처리했지만, 증거를 포함하는 25개의 정확한 사례와 비교했습니다. gpt-oss-20b는 32개 대 30개였습니다. 이러한 격차는 작성자가 정의한 완전한 인용 세트와의 불일치를 설명할 뿐, 반드시 지원되지 않는 추출 필드를 의미하지는 않습니다.
초기 Gemini 프롬프트 비교
| Variant | Completed / 40 | Exact correct / 40 | Both-correct pairs / 20 | Invalid schemas | Unsupported cash values | Invented cash receipts |
| --- | --- | --- | --- | --- | --- |
| Plain | 40 | 40 | 20 | 0 | 0 | 0 |
| Grounded | 40 | 40 | 20 | 0 | 0 | 0 |
두 v2 실행 모두에서 모든 7개 필드 정확도와 증거 일치도가 100%였으며, 요청 오류는 없었습니다. 추가적인 근거 기반(grounded) 알림은 이 데이터셋에서 측정 가능한 이점이 없었습니다.
Gemini 프롬프트 두 가지 모두에서 살아남은 세 가지 구체적인 차이점:
- 총액 2,500 USD의 풀에 5명의 당첨자 각각에게 500 USD가 명시된 경우, 개인 최대 금액은 500으로 산출되었습니다. 분배가 명시되지 않은 경우, 두 프롬프트 모두 null 개인 금액을 반환했으며 통화는 USD를 유지했습니다. 풀이 약속된 개인 지급액이 되지는 않았습니다.
- 공지된 60 USD의 상금은 확정된 현금 수령액을 산출하지 못했습니다. 이와 쌍을 이루는 은행 배달 기록은 6,000 USD 센트를 산출했습니다. 광고된 금액은 그대로 60이었는데: 제공 조건과 수령액은 서로 다른 필드입니다.
- 전달되고 사용된 상점 상품권도 출처가 명시적으로 현금 이체가 없다고 했기 때문에 여전히 0의 현금 수령액을 산출했습니다. 이는 카드가 가치가 없다는 것을 의미하지 않습니다. 이 필드는 모든 경제적 이익이 아닌, '현금'만을 측정합니다.
루브릭(rubric) 검토도 중요합니다. 지원되지 않는 선택 용어를 요구하는 채점자는 정당한 자제(restraint)를 오류로 표시할 수 있습니다. 증거 기반의 규율은 모델뿐만 아니라 벤치마크 작성자에게도 적용됩니다.
한계 (Limits)
Gemini는 이 작은 구성 진단에서 한계에 도달했습니다. 관찰된 세 모델 간의 차이는 실제 유료 작업 프로그램 전반에 걸쳐 일반적인 순위나 정확도를 추정할 수 있게 해주지 않습니다. 관련 쌍들은 40개의 독립적인 관측치가 아닙니다. 상태(Status)와 전달(Delivery)은 종종 명시적이며, 문서들은 영어이고 영수증 장부(receipt ledger)는 USD 전용입니다. 증거 세트(Evidence sets)는 작성자 정의이며, 관찰된 응답이 공개된 루브릭 수정에 영향을 주었습니다. Gemini만이 두 가지 프롬프트 변형을 모두 받았고, 다른 모델들은 근거 기반(grounded only)으로만 받았습니다. 제공업체 행동과 효과적인 생성 설정은 독립적으로 통제되지 않았습니다.
독립적인 레이블 검토, 재현 가능한 비교, 추가 통화, 그리고 상태 진술이 덜 명시적인 허용된 자연 문서들은 여기에 완료된 결과가 아니라 가치 있는 미래 측정입니다. 실질적인 비서(practical assistant)는 광고된 조건, 자격 요건, 제출 단계, 수상 및 지급된 금액을 각각 추적하고, 각 결정에 대한 출처 증거를 제시해야 합니다.
나의 벤치마크 (My Benchmark)
Kaggle의 보상 증거(Open Reward Evidence on Kaggle). 이 컬렉션은 근거 기반 작업 버전 2(grounded task version 2)를 사용하며, 평균 작업 점수는 리더보드에 표시됩니다.
케이스와 채점기(grader)는 독창적인 작업물입니다. 러너(runner)는 Kaggle Benchmarks SDK와 그 공식 퀵 스타트 가이드를 사용합니다. 파일럿 및 v2 아티팩트는 별도로 보관되어 수정된 결과가 원래의 측정을 지우지 않도록 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기