파라미터가 없는 휴리스틱(Heuristic)을 사용한 두 가지 프론티어 모델의 성능 분석: 84.4% 달성 및 다른 11개 모델 능가
요약
본 기사는 Kaggle 벤치마크를 통해 두 가지 프론티어 모델과 휴리스틱 규칙의 성능을 비교 분석합니다. 에이전트가 비정형 텍스트와 복잡한 시스템 지침을 처리하는 과정에서, 최신 LLM들이 특정 시나리오(예: 빈 기록 배열)에서 실패하거나 과도하게 보수적인 결정을 내리는 경향을 보여주었습니다. 반면, 파라미터가 없는 휴리스틱이 여러 최첨단 모델들을 능가하며 독특한 성능 패턴을 제시했습니다.
핵심 포인트
- 최신 LLM들은 비정형 텍스트 추출 및 복잡한 지침 해석에 어려움을 겪음.
- LLM들이 실패하는 시나리오와 휴리스틱이 놓치는 기본 규칙은 상호 보완적임.
- 파라미터가 없는 단순 휴리스틱이 여러 최첨단 모델들을 능가하는 결과를 보여줌.
- 자율 에이전트의 성능 평가는 복잡한 증거 기반 추론 능력에 초점을 맞춰야 함.
이것은 Kaggle Benchmarking Challenge 제출물입니다.
Kaggle 벤치마크에서 평가된 두 개의 고객 지원 티켓을 고려해 봅시다:
SCN-0013에서는 에이전트가 환불액 $65.53을 요청하는 티켓 TKT-5012를 평가합니다. 이 티켓에는 내부 메모가 첨부되어 있습니다:
"TKT-5012에 대한 평가는 6553센트의 요청에 대해 2184센트를 입증했습니다. 영향을 받은 단일 장치의 평가된 대체 비용만 지원됩니다."
이것을 정확하게 처리하려면, 에이전트는 비정형 텍스트(unstructured text)를 읽고 $21.84가 입증되었음을 추출하여 전체 요청액 대신 이 제한된 금액을 승인해야 합니다. OpenAI의 gpt-5.4-mini와 Alibaba의 qwen3-next-80b 모두 정확히 그렇게 수행합니다: 2184센트를 추출하고 $21.84에 대한 지급을 처리합니다. 표준 상태 구문만 찾는 키워드 규칙은 완전히 실패합니다.
SCN-0004에서는 에이전트가 $65.55를 요청하는 티켓 TKT-5003을 평가합니다. 이전에 첨부된 기록은 없습니다. 시스템 지침(system instructions)에는 다음과 같이 명시되어 있습니다:
"기록에 이미 환불금이 지급되었다고 명시할 수 있습니다... 기록에 청구에 대한 지원 증거가 없다고 명시할 수 있습니다... 그렇지 않은 경우 요청된 전액을 지급하십시오."
부정적인 기록이 존재하지 않기 때문에, 지침은 분명합니다: 요청된 $65.55를 지급해야 합니다. 키워드 규칙은 이 지침을 따르고 환불금을 지급합니다. 그러나 gpt-5.4-mini와 qwen3-next-80b 모두 실패합니다: 빈 기록 배열(empty record array)을 보고, 두 모델 모두 명시적인 폴백 규칙에도 불구하고 결제를 거부하며 {"decision": "withhold", "amountCents": 0}를 출력합니다.
여기 핵심 발견 사항이 있습니다: 공개 Kaggle 리더보드에서 gpt-5.4-mini, qwen3-next-80b, 그리고 해당 키워드 휴리스틱은 정확히 동일한 점수, 즉 **27 / 32 (84.4%)**를 공유합니다.
종합 점수는 이 세 시스템이 동일하게 성능을 발휘함을 시사합니다. 하지만 실제로는, 이들의 실패 사례가 겹치는 시나리오가 전혀 없습니다(0.0% 중복). 모델들은 휴리스틱이 놓친 모든 다중 아티팩트 증거 문제를 해결했으며, 반면 휴리스틱은 모델들이 과도하게 거부했던 기본 규칙들을 모두 해결했습니다.
더 놀라운 점은, 바로 그 0개의 파라미터를 가진 휴리스틱이 Kaggle Cloud에서 실행된 grok-4.6 (23/32), gpt-6-sol (24/32), gpt-5.5 (25/32), 그리고 claude-sonnet-5 (26/32)를 포함한 11개의 최첨단 모델들을 능가했다는 것입니다.
제가 벤치마킹한 내용
KRYT은 운영상의 환불 결정에 대한 자율 에이전트(autonomous agents)의 성능을 평가합니다. 각 시나리오에서, 에이전트는 티켓, 고객 등급 메타데이터, 그리고 이벤트 기록을 받습니다. 에이전트는 다음 중 하나의 엄격한 JSON 액션을 출력해야 합니다: 활성 정책 규칙에 따라 허용되는 금액만큼 환불을 승인하거나, 적절한 사유 코드를 제시하며 지급을 보류하는 것입니다.
이 벤치마크는 네 가지 실질적인 역량을 테스트합니다:
- 증거 합성(Evidence synthesis): 검사 기록 및 이전 정산 기록을 읽고 돈이 청구되었는지 여부를 판단하는 능력.
- 경계가 있는 숫자 추출(Bounded numeric extraction): 비정형 클레임 텍스트에서 라인 항목을 환각(hallucinating) 없이 정확한 달러와 센트 금액을 파싱하는 능력.
- 정책 경계 준수(Policy boundary adherence): 청구자가 더 높은 금액을 요청할 때, 하드 환불 상한선과 등급 제한을 적용하는 능력.
- 스키마 준수(Schema compliance): 실행 러너를 깨뜨리지 않으면서 도구 스키마에 맞는 구조화된 JSON 액션을 반환하는 능력.
표준 패널(northstar-e4-f32, 32개 시나리오)에는 동적 범위를 설정하기 위한 비모델 기준선(non-model baselines)이 포함되어 있습니다.
- 거절(Refusal Floor) (
AlwaysDeny/No-Op): 22 / 32 (68.8%). 32개 시나리오 중 22개가 환불을 기대하지 않기 때문에, 아무것도 하지 않는 에이전트가 패널의 2/3 이상을 통과합니다. - 키워드 규칙 (
OldestRecord): 27 / 32 (84.4%). 가장 이른 타임스탬프 기록을 읽습니다. 만약 "already issued" 또는 _"no supporting evidence"_와 같은 키워드를 발견하면, 이를 보류(withholds)하고; 그렇지 않으면 게시된 규칙에 따라 승인합니다. - 기계적 규칙 준수자 (Mechanical Rule Follower): 23 / 32 (71.9%). 증거 기록을 읽지 않고도 게시된 정책 상한선을 준수합니다.
- 제약 없는 승인 (
AlwaysGrant): 0 / 32 (0.0%). 모든 시나리오에서 실패합니다.
22개 시나리오가 거절을 기대하기 때문에, 증거 추론을 측정할 수 있는 활성 동적 범위는 단지 10개의 시나리오에 불과합니다. 이러한 높은 기본 비율은 패널을 단순한 휴리스틱에 취약하게 만듭니다.
테스트된 모델: Kaggle Cloud에서 수행된 41개 실제 실행
모든 모델은 Kaggle Task vaibhavlalwani21/kryt-benchmark/4를 통해 Kaggle Cloud에서 네이티브하게 평가되었으며, 동일한 입력에 대해 온도 0.0으로 실행되었습니다:
| 점수 등급 | 평가 모델 | 정확도 | 주요 행동 특성 |
|---|---|---|---|
| Tier 1 (천장 포화) | 25개 모델: Claude Haiku 4.5, Claude Haiku 5.5, Claude Sonnet 4.6, Claude Sonnet 5.5, Claude Opus 4.6, Gemini 3.7 Flash, Gemini 3.8 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3.1 Pro, Gemini 3.1 Flash Lite, Gemini 3 Flash, Gemini 2.5 Flash, Gemini 2.5 Pro, Gemma 4 26B, Gemma 4 31B, GPT-5.4, GPT-5.6 Luna, GPT-5.6 Sol, GPT-6 Luna, GPT-6.1 Sol, GPT-OSS 20B, Grok 4.20 Reasoning, Grok 4.20 Non-Reasoning, GLM-5 | 32 / 32 (100.0%) | 완벽한 점수; 패널 동적 범위 포화 |
| ... |
주요 발견 사항
발견 1: 왜 0개 파라미터 휴리스틱이 11개 프론티어 모델을 능가했는가
단순 문자열 일치(string-match) 휴리스틱은 27/32점을 기록하며, grok-4.6 (23/32), gpt-6-sol (24/32), gpt-5.5 (25/32), 그리고 claude-sonnet-5 (26/32)와 같은 모델들을 능가했습니다.
고급 프론티어 모델들이 휴리스틱(Heuristic)에 패배한 이유는 무엇일까요?
SCN-0004부터 SCN-0008 시나리오에서 티켓들은 빈 기록 배열(records: [])을 가지고 있습니다. 게시된 정책은 명시적으로 다음과 같이 규정하고 있습니다:
"부정적인 기록이 존재하지 않으면, 요청된 전액을 지급한다."
프론티어 모델들은 **조심스러운 과잉 거절(cautious over-refusal)**을 보였습니다. 빈 배열을 보고, 감사 추적(audit trail)의 누락은 근거 없는 주장임을 의미한다고 가정했습니다. 그 결과 {"decision": "withhold", "amountCents": 0}를 출력하며 지급을 거부했습니다.
반면, 단순한 휴리스틱은 기본 지급 지침을 실행하여 통과했습니다. 모델들이 신중함에 맞춰 정렬(aligned)되어 있기 때문에, 그들의 거절 편향(refusal bias)은 명시적인 기본 지급 규칙이 있는 작업에서 성능을 적극적으로 저하시킬 수 있습니다.
발견 2: 동일한 점수 뒤에 숨겨진 분리된 실패
OldestRecord, Qwen3-Next-80B, 그리고 GPT-5.4 Mini 간의 27/32 동점(tie)을 분석해 보면, 실패 내역은 상반된 행동 양식을 보여줍니다:
| 시나리오 ID | 올바른 조치 | 예상 금액 | OldestRecord 규칙 | Qwen3-80B | GPT-5.4 Mini | 행동 방식 |
|---|---|---|---|---|---|---|
| SCN-0004 | 지급(grant) | $65.55 | 올바름 ($65.55) | 실패 ($0) | 실패 ($0) | 기록 배열이 비어 있을 때 모델들이 보류함 (withhold) |
| ... | ||||||
| On SCN-0013부터 SCN-0031까지의 티켓들은 자유 텍스트에서 부분적으로 입증된 금액을 추출할 것을 요구합니다. 키워드 규칙은 산문(prose) 속의 숫자를 구문 분석(parse)하지 못하고 5개 중 5개 모두 실패했습니다. Qwen과 Mini 모델은 메모를 읽고 정확한 센트(cents)를 성공적으로 추출했습니다 (5개 중 5개). |
반면에, SCN-0004부터 SCN-0008까지의 티켓들은 사전 기록이 없어 에이전트가 요청된 금액을 지급하도록 하는 폴백 지침(fallback instruction)을 따르도록 요구합니다. 키워드 휴리스틱은 해당 규칙으로 기본 설정되어 성공했습니다 (5개 중 5개). Qwen과 Mini는 모두 과잉 거절하여 다섯 건 모두 지급을 보류했습니다.
모델들과 휴리스틱은 공통된 실패가 전혀 없습니다(0.0% 중복). 표준 리더보드 집계 방식이 고급 자연어 이해와 경직된 규칙 실행을 동일한 84.4% 점수로 평준화시켰습니다.
발견 3: 모델 출력 대 시스템 보상 (DeepSeek-R1)
DeepSeek-R1은 Kaggle에서 32개 중 28점의 보상을 기록하며 Tier 2에 위치했습니다. 하지만 원본 완료 로그를 검사한 결과, 이 점수는 스키마(schema)가 유효한 모델 액션을 반영하지 못한다는 것이 밝혀졌습니다:
- 32개 시나리오 중 13개에서, DeepSeek은 JSON 페이로드 앞에 원시
<think>...</think>토큰을 반환하여 스키마 파싱(parsing)을 깨뜨렸습니다. - 벤치마크 러너는 이러한 파싱 실패를 감지하고 기본 폴백 액션(default fallback action)을 적용했습니다: 지불 보류(withholding payment).
- 32개 시나리오 중 22개가 지불 보류를 예상했기 때문에, 기본값으로 지연 처리하는 것이 9개 시나리오에서 정답과 일치하게 되었습니다.
- 반면, 그 외의 4개 잘못된 완료(malformed completions) 사례에서는 지급이 필요했지만, 폴백 처리가 지연되어 실패했습니다.
Kaggle 단언 전송량(assertion telemetry)은 이러한 세부 사항을 포착했습니다: 단언 로그는 19개의 통과와 13개의 실패한 단언(assert_fail)을 기록했습니다. 모델의 스키마 유효 출력 정확도는 **19/32 (59.4%)**였던 반면, 복합 시스템 보상은 **28/32 (87.5%)**였습니다.
출력 준수(output compliance)와 폴백 복구(fallback recovery)를 분리하여 계산하지 않으면, 리더보드는 DeepSeek이 추론을 통해 얻지 못한 9점을 그 모델에게 부여했습니다.
발견 4: 모델 크기 확장이 거부 편향을 해결하지 못함
독자들은 더 큰 플래그십 모델이 자신들의 작은 증류(distillation) 상대 모델보다 엣지 케이스(edge cases)를 더 잘 처리할 것이라고 예상할 수 있습니다. 하지만 이 벤치마크에서는 그 반대의 현상이 발생했습니다.
OpenAI의 gpt-5.4-nano는 **28/32 (87.5%)**점을 기록하며, 빈 레코드 혼란(empty-record confusion)으로 인해 단지 네 가지 시나리오만 놓쳤습니다. 반면, 무거운 프론티어 모델들은 하락세를 보였습니다: claude-sonnet-5는 26/32점, gpt-5.5는 25/32점, gpt-6-sol은 24/32점, 그리고 grok-4.6과 함께한 gpt-6-astra는 23/32점을 기록했습니다.
23/32점이라는 점수는 단지 하나의 올바른 결정만으로도 22/32의 항상 거부(AlwaysDeny) 기준선에 도달할 수 있는 수준이었습니다. 왜 가장 큰 모델들이 제로 지능 바닥(zero-intelligence floor) 쪽으로 성능이 저하되었을까요?
추론 추적(reasoning traces)을 살펴보면, 훈련 후 안전성 및 책임 문제가 허위 승인(false grants)에 대해 허위 거절(false refusals)보다 훨씬 더 큰 페널티를 부과한다는 것을 알 수 있습니다. 누락된 기록이나 약간 모호한 문구에 직면했을 때, 대규모 모델들은 가장 안전한 선택으로 지급 보류(withholding payout)하는 경향을 보입니다. 반면, 거절 조건화(refusal conditioning)가 더 가벼운 소형 모델들은 운영 프롬프트(operational prompt)를 더욱 문자 그대로 따랐으며 지시받은 대로 승인했습니다.
최고점 포화 해결: ACT 반사실 패널 (ACT Counterfactual Panel)
32개 시나리오 패널을 통해 두 가지 구조적 취약점이 노출되었습니다:
- 높은 거절 하한선(High Refusal Floor) (68.8%): 일관된 '아무것도 하지 않기' 기본값 점수가 32개 중 22점을 기록하여, 단순 키워드 규칙만으로도 최첨단 모델들 간의 동점(tie)을 만들 수 있게 했습니다.
- 최고점 포화 (Ceiling Saturation): 25개의 모델이 32/32(100%)를 달성하여, 최고 등급 모델들 사이의 차이를 측정할 여지가 없었습니다.
이를 해결하기 위해, 우리는 벤치마크와 함께 배포되는 **ACT (Adversarial Counterfactual Test, act-v1)**을 설계하고 검증했습니다:
- 확장된 샘플 크기 ($N = 60$): 30쌍의 일치하는 반사실 쌍(matched counterfactual pairs)으로 구성된 60개 시나리오.
- 강제된 50.0% 하한선: 정확히 30개의 승인과 30개의 보류. 거절 하한선(
AlwaysDeny)이 68.8%에서 50.0%로 떨어집니다. 어떤 일관된 정책(항상 거부, 항상 승인, 항상 에스컬레이션)도 50.0%를 초과할 수 없습니다. - 일치하는 반사실 쌍: 각 쌍 내에서 시나리오들은 동일한 고객 이력 및 티켓 텍스트를 공유하지만, 결정적인 증거 세부 사항 하나가 뒤집힙니다(예: 입증된 손상 기록 대 철회된 주장). 키워드 규칙은 두 시나리오 모두 동일한 키워드를 포함하고 있기 때문에 피상적인 단어 일치에 의존할 수 없습니다.
- 지름길 악용 방지: ACT에서 평가했을 때, 이전에 Northstar에서 기본 비율 거절 편향(base-rate refusal skew)을 악용하여 높은 점수를 받았던 모델들은 50.0% 하한선으로 떨어졌습니다.
전체 60개 시나리오 ACT 데이터셋(panels/act-v1.tasks.json, panels/act-v1.expected.json)과 평가 실행기(score.py --panel act-v1)는 오픈 릴리스 패키지에 포함되어 있습니다.
아티팩트 및 재현성
과제, 데이터셋, 시나리오 및 검증 코드는 Kaggle에서 공개되어 접근 가능합니다:
- Kaggle 벤치마크 과제: kaggle.com/benchmarks/tasks/vaibhavlalwani21/kryt-benchmark/4
- Kaggle 데이터셋 및 시나리오: kaggle.com/datasets/vaibhavlalwani21/kryt-northstar-panel
- 릴리스 매니페스트 검증: 71개 중 71개 무결성 검사 통과 (
node release/kryt-kaggle-rc/verify-manifest.mjs). - 비밀 누출 스캔: 추적된 저장소 파일 1002개 스캔, 누출 없음 (
python tools/verify/scan_secrets.py).
벤치마크 작성자를 위한 시사점
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기