
매출 보고서 생성, 표 형식과 자연어 형식에 따라 3개사의 수치 추출 정확도가 달라졌다
요약
매출 데이터를 표 형식과 자연어 형식으로 나누어 ChatGPT, Claude, Gemini의 보고서 생성 능력을 비교 실험했습니다. 입력 데이터의 형식에 따라 모델별 수치 추출 정확도와 순위가 크게 달라짐을 확인했습니다.
핵심 포인트
- 표 형식에서는 Claude가 가장 높은 정확도를 보였습니다.
- 자연어 형식에서는 Gemini가 가장 우수한 성능을 기록했습니다.
- 구조화된 입력은 필드 경계가 명시되어 값의 대응 오류를 줄여줍니다.
- 입력 형식(Format)에 따라 모델의 성능 순위가 역전될 수 있습니다.
TL;DR
- 동일한 매출 데이터를 「표 형식(라벨이 붙은 수치의 나열)」과 「자연어 형식(문장 속에 숫자를 포함한 메모)」의 두 가지 방식으로 준비하여, ChatGPT · Claude · Gemini에게 동일한 프롬프트로 보고서 생성을 시켰으며, 수치 정확성 · 구성 · 망라성(completeness)의 3개 항목으로 채점했다.
- 표 형식에서는 Claude가 만점을 받았으나, 자연어 형식에서는 반대로 Claude가 최하위로 떨어졌고 Gemini가 역전하여 1위를 차지했다. 동일한 태스크 · 동일한 모델군이라도 입력의 「형식」만으로 순위가 뒤바뀐다.
- 표 형식이라도 라벨(필드명)을 생략하고 수치만 나열하면, 위치 정보에만 의존하여 오독하는 사례가 발생했다. 구조화된 입력(structured input)의 강점은 형식 그 자체가 아니라, 필드 경계가 명시되어 있다는 점에서 기인한다.
- 샘플 수는 1회 · 각 조건당 1회 시도에 불과하며, 생성의 비결정성(temperature에 따른 변동성)을 고려할 때, 이는 경향성을 관찰한 것이지 통계적인 결론은 아니다.
배경
이전 기사에서 제안서의 골자를 만드는 태스크의 경우 「참고 자료의 분량(짧음/길음)」에 따라 AI의 승자가 달라진다는 것을 확인했다. 이번에는 그 발전 단계로서, 분량이 아니라 입력의 「형식」, 즉 동일한 정보량의 데이터를 구조화된 표 형식으로 전달할지, 아니면 자연어에 포함하여 전달할지에 따라 수치를 다루는 태스크의 정확도가 변하는지를 검증했다.
실험 설정
지난주 5일간 · 3개 상품의 매출 데이터를 두 가지 형식으로 준비했다.
표 형식(라벨이 붙은 수치의 나열):
8/25: 상품A 42,000엔 / 상품B 18,500엔 / 상품C 9,800엔
8/26: 상품A 39,500엔 / 상품B 21,000엔 / 상품C 11,200엔
8/27: 상품A 45,800엔 / 상품B 17,300엔 / 상품C 8,900엔
...
자연어 형식(동일한 정보를 문장 속에 포함한 것):
월요일은 상품A가 42,000엔, 상품B가 18,500엔, 상품C가 9,800엔 팔렸습니다. 화요일은 상품A가 조금 떨어져 39,500엔이었지만, 상품B는 21,000엔까지 늘어났습니다. 상품C는 11,200엔입니다. 수요일은 상품A가 45,800엔으로 주간 최고치, 상품B는 17,300엔, 상품C는 8,900엔이었습니다. 목요일은 상품A가 41,200엔, 상품B가 19,900엔, 상품C가 10,500엔. 금요일은 상품A가 48,000엔으로 주간 최고치를 경신, 상품B도 22,400엔으로 이번 주 최고, 상품C는 12,100엔이었습니다.
두 형식 각각을 다음의 동일한 프롬프트로 ChatGPT · Claude · Gemini에게 전달했다.
이하는 이번 주(8/25~8/29)의 매출 데이터입니다.
(여기에 표 형식 또는 자연어 형식 중 하나를 붙여넣기)
이 데이터를 바탕으로 상사에게 제출할 매출 보고서를 작성해 주세요.
...
평가는 「수치의 정확성(주간 합계 · 최고치 요일의 일치)」, 「구성의 이해도(clarity)」, 「누락의 적음(3개 상품 모두 언급)」의 3개 항목 · 각 5점으로, 원본 데이터와 대조하여 채점했다.
결과
표 형식을 전달했을 경우: Claude 15점, Gemini 13점(상품C의 하루 치를 합계에 포함하는 것을 누락), ChatGPT 12점(최고치 요일을 금요일이 아닌 월요일로 오답).
자연어 형식을 전달했을 경우: Gemini 14점, ChatGPT 13점, Claude 11점(상품B의 화요일 21,000엔을 놓쳐서 주간 합계가 1,000엔 차이 남).
동일한 태스크 · 동일한 모델군임에도 불구하고, 입력 형식을 바꾸는 것만으로 1위가 바뀌었다.
원리 1: 구조화된 입력은 필드 경계가 명시되기 때문에 값의 대응 오류가 작다
표 형식의 입력은 「상품명 라벨 + 수치」라는 형태로 필드의 경계가 명시되어 있다. 모델은 어떤 수치가 어떤 상품 · 어떤 날짜에 속하는지를 문자열 패턴의 위치 관계를 통해 거의 일의적(uniquely)으로 결정할 수 있다.
반면, 자연어 형식에서는 동일한 정보가 「조금 떨어져 39,500엔」과 같이 지시어나 생략을 포함한 문장 속에 매몰되어 있다. 어떤 수치가 어떤 실체(상품 · 요일)에 대응하는지를 결정하려면 통사적인 의존 관계(syntactic dependency)나 문맥 참조(contextual reference) 해결이 필요하며, 이는 구조화된 데이터의 단순한 위치 대응보다 해결해야 할 모호성의 단계가 하나 더 많다. 이번에 Claude가 자연어 형식에서 화요일 상품B의 수치를 놓친 것은, 이 참조 해결 과정 중 어딘가에서 대응 관계가 무너졌기 때문이라고 생각된다.
원리 2: 구조화된 입력의 강점은 「표라는 외관」이 아니라 「라벨의 명시」에 있다
검증 과정에서 표 형식의 데이터로부터 라벨(상품명)을 제외하고 수치만 「42,000 / 18,500 / 9,800」과 같이 나열하여 전달했더니, 여러 모델에서 어떤 수치가 어떤 상품인지 혼동하는 오답이 증가했다.
이는 구조화된 입력 (Structured Input)이 정확도에 영향을 미치는 이유가 단순히 "표와 같은 외형을 하고 있기 때문"이 아니라, "각 값이 어떤 필드 (Field)에 속하는지를 나타내는 라벨 (Label)이 명시되어 있기 때문"임을 보여준다. 라벨을 잃은 표 형식은 실질적으로 자연어 형식 (Natural Language Format)과 비슷하거나 그 이하 수준까지 모호성이 되돌아간다. 표 형식을 사용하는 것 자체가 목적이 아니라, 필드 경계 (Field Boundary)를 명시하는 것이 본질적인 요인이라고 생각된다.
원리 3: 단일 시행의 관측이며, 모델 간의 일반적인 우열을 주장하는 것이 아니다
이 검증은 각 조건당 1회 시행(Single Trial)일 뿐이며, 생성의 비결정성 (Non-determinism, temperature에 의한 출력의 변동성)을 고려하면 동일한 프롬프트 (Prompt)를 재실행했을 때 결과가 달라질 가능성이 있다. 또한 이번에는 데이터 규모도 5일 × 3개 상품으로 작았으며, 더 큰 표나 더 복잡한 자연어 (숫자가 떨어진 곳에 흩어져 있거나 조건 분기를 포함하는 등)에서는 경향이 바뀔 가능성도 충분히 있다. 여기서 관찰된 것은 "입력 형식에 따라 동일 모델 내에서도 정확도가 변동될 수 있다"라는 현상 그 자체이며, "어떤 모델이 수치 태스크 (Numerical Task)에 강한가"라는 일반적인 우열에 대한 주장이 아니다.
효과가 없었던 것
- 라벨을 생략한 표 형식: 외형은 구조화된 데이터 형태를 유지하더라도, 필드 라벨 (Field Label)을 생략하면 수치 매칭 오류가 증가했다. 표라는 형식 자체보다 라벨의 명시가 효과적이었다.
- "자연어가 더 읽기 쉬운 보고서가 될 것이다"라는 예상: 실제로는 자연어 형식을 전달하면 수치 전사 누락이나 계산 실수가 발생하기 쉬웠으며, 특히 Claude에서 두드러졌다. 가독성과 수치의 정확성은 트레이드오프 (Trade-off) 관계가 될 수 있다.
요약
수치가 포함된 태스크를 LLM에 전달할 때는 (1) 표 형식이라 하더라도 라벨을 생략하지 말 것, (2) 자연어 형식은 참조 해결 (Reference Resolution)의 모호성이 한 단계 증가하는 만큼 수치 전사 및 집계 실수의 리스크가 높아질 것, (3) 이번 순위는 단일 시행의 관측이므로 일반화할 수 없다는, 이 세 가지 점을 고려하여 운용하는 것이 타당할 것이다. 실무에서는 수치의 정확성이 중요한 태스크일수록, 다소 장황하더라도 라벨이 포함된 구조화된 입력 (Structured Input)을 준비할 가치가 있다.
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기