
제안서 골자 생성 시 참고 자료가 4,000자를 넘으면 AI 순위가 뒤바뀌는 이유 검증
요약
제안서 골자 생성 태스크에서 참고 자료의 분량에 따른 ChatGPT, Claude, Gemini의 성능 차이를 실험했습니다. 입력 데이터가 4,000자 이상으로 길어질 경우, Claude는 높은 논리성과 정보 유지력을 보인 반면 ChatGPT는 정보 누락이 발생하며 순위가 하락했습니다.
핵심 포인트
- 입력 데이터가 길어질수록 컨텍스트 윈도우와 실효 참조 능력이 중요해짐
- Claude는 장문 데이터에서 높은 논리성과 정보 회상 능력을 입증
- ChatGPT는 긴 입력 시 후반부 정보의 누락 가능성이 확인됨
- 장문 대응력과 구조화 출력 능력은 별개의 변수로 관리 필요
TL;DR
- 「제안서 골자 만들기」 태스크에서, ChatGPT・Claude・Gemini에게 (A) 짧은 참고 메모(약 200자)와 (B) 긴 참고 자료(경쟁 3사 비교 + 시장 동향, 약 4,000자)를 각각 전달하고, 구성의 논리성·누락의 적음·읽기 쉬움의 3개 항목(각 5점)으로 채점했다. 짧은 메모에서는 ChatGPT 13점・Claude 13점・Gemini 11점으로 거의 비슷했으나, 긴 자료에서는 ChatGPT 10점・Claude 14점・Gemini 12점이 되어 Claude가 독주하고 ChatGPT는 반대로 순위가 하락했다.
- Claude는 최대 100만 토큰(Token)의 컨텍스트 윈도우(Context Window)를 가지며, 이는 ChatGPT의 일반적인 처리량의 약 8배에 해당한다(2026년 8월 시점의 여러 비교 기사에서 확인). 입력이 짧은 동안에는 어느 모델이나 전체량을 한 번에 처리할 수 있어 차이가 나기 어렵지만, 입력이 길어질수록 「한 번에 어디까지 유지·참조할 수 있는가」라는 상한선의 차이가 누락이라는 형태로 표면화된다.
- 다만 분량에 강한 모델을 선택하는 것만으로는 불충분하며, 장 구성(결론→배경→경쟁 비교→제안)을 명시하지 않으면 전달한 자료의 출현 순서를 그대로 반영한 골자가 되기 쉬웠다. 장문 대응력과 구조화 출력(Structured Output)은 별개의 변수다.
실험 설정
주제는 「신상품 제안서 골자 만들기」라는 태스크다. 상정 타겟·가격·차별화 포인트를 작성한 공통 지시문(Prompt)에 대해, 참고 자료의 분량만을 변수로 하여 두 가지 조건으로 비교했다.
- 패턴 A: 짧은 참고 메모(본인의 불렛 포인트, 약 200자)
- 패턴 B: 긴 참고 자료(경쟁 A사·B사·C사의 기능 비교를 문장화한 것 + 시장 동향 메모, 약 4,000자)
채점은 3개 항목 × 5점 만점(구성의 논리성 / 누락의 적음 / 읽기 쉬움)이다. 프롬프트의 골격(의뢰문·타겟·가격·차별화 포인트)은 두 조건에서 완전히 동일하게 유지하고, 마지막에 붙이는 참고 자료의 분량만 변경했다.
결과
패턴 A (짧은 참고 메모, 약 200자):
- ChatGPT: 논리성 4 / 누락 4 / 읽기 쉬움 5 = 13점
- Claude: 논리성 5 / 누락 4 / 읽기 쉬움 4 = 13점
- Gemini: 논리성 4 / 누락 3 / 읽기 쉬움 4 = 11점
패턴 B (긴 참고 자료, 약 4,000자):
- ChatGPT: 논리성 3 / 누락 3 / 읽기 쉬움 4 = 10점
- Claude: 논리성 5 / 누락 5 / 읽기 쉬움 4 = 14점
- Gemini: 논리성 4 / 누락 4 / 읽기 쉬움 4 = 12점
짧은 입력에서는 모델 간의 차이가 미미했으나, 입력을 4,000자로 늘린 순간 Claude가 최고점, ChatGPT가 최저점으로 순위가 뒤바뀌었다. 특히 ChatGPT는 자료의 후반부에 배치한 세 번째 회사(C사)의 비교 포인트가 골자에 거의 반영되지 않는 결과가 나왔다.
기술적인 원리
1. 컨텍스트 윈도우(Context Window)의 절대적 크기 차이
Claude는 최대 100만 토큰(원고지 1,500매 상당)의 컨텍스트 윈도우를 가지며, ChatGPT의 일반적인 처리량의 약 8배에 달한다고 하는 2026년 8월 시점의 여러 비교 기사(신미도, Digital Workflow Lab)를 확인했다. 4,000자(일본어로 대략 1~2천 토큰 정도) 자체는 어느 모델의 상한선에도 훨씬 못 미치기 때문에, 단순한 「수용 가능한가 아닌가」의 문제는 아니다. 오히려 학습·튜닝(Tuning) 단계에서 얼마나 긴 실효 컨텍스트를 상정하여 최적화가 되어 있는가라는 「실효적인 참조 능력」의 차이가, 명목상의 윈도우 사이즈 안에 들어오는 입력에서도 나타나기 쉽다고 생각된다.
2. 입력 내 위치에 따른 정보 회상(Recall)의 편향
장문 입력에 대해 모델이 입력 중 어느 위치의 정보를 얼마나 정확하게 참조할 수 있는지는 일정하지 않으며, 위치에 따라 회상 정밀도가 변동하는 현상이 알려져 있다(이른바 Lost in the Middle 계열의 연구에서 지적되는 위치 편향). 이번 C사 정보는 자료의 말미(세 번째 회사)에 배치했기 때문에, 말미 쪽의 회상 정밀도가 상대적으로 낮은 모델일수록 누락이 발생하기 쉬웠을 가능성이 있다. 다만 이번에는 1회의 시도로 관측한 것이며, 자료 중의 배치 순서를 바꾸어 재검증하지는 않았으므로 위치 편향 자체가 원인이라고 단정할 수는 없다.
3. 장문 대응력과 구조화 출력(Structured Output)은 독립된 변수
Claude가 최고점이었던 패턴 B에서도, 장 구성 템플릿(결론→배경→경쟁 비교→제안 순서 등)을 명시하지 않았을 경우에는 자료에 적힌 정보의 출현 순서를 그대로 답습한 골자가 되기 쉬운 경향이 나타났다. 긴 입력을 누락 없이 참조하는 것과, 그것을 의도한 구성으로 출력하는 것은 별개의 태스크이며, 후자는 출력 측의 포맷 지정(구조화 출력의 명시)을 통해 담보할 필요가 있다.
효과가 없었던 것
「전부 읽고 반영해 주세요」라는 지시만으로는 ChatGPT는 자료 후반부의 정보를 놓쳤다. 「특히 세 번째 회사의 비교 포인트를 간과하지 마세요」라고 특정 정보를 지목하여 강조하면 누락은 다소 개선되었으나, 그럼에도 패턴 B인 Claude의 점수에는 도달하지 못했다. 특정 정보를 지목하는 추가 지시는 대증요법일 뿐, 모델 측의 실질적인 참조 능력(Reference capability) 차이 자체를 메우는 것은 아니라고 판단된다.
요약
참고 자료가 짧은(수백 자 정도의) 의뢰에서는 모델 간의 차이가 무시할 수 있는 범위였다. 경쟁사 자료나 시장 조사 등 수천 자 규모의 자료를 근거로 하는 구성 생성 태스크에서는, 컨텍스트 윈도우(Context window)가 큰 모델(이번 사례에서는 Claude)을 선택하는 것이 정보 누락이 적다는 점에서 우위를 점했다. 다만, 장(Chapter) 구성 템플릿 지정은 분량과 관계없이 별도로 필요하며, 긴 문장 대응 능력이 높다고 해서 구성 능력이 높음을 자동으로 보장하는 것은 아니다.
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기