매일 Claude에게 같은 질문 100개를 던지자: 어느 날 Haiku 4.5가 흔들림을 멈추다
요약
작성자는 Claude 모델에게 매일 동일한 100개의 질문을 던지고 답변을 기록하는 실험을 진행했습니다. 이 과정을 통해 모델의 출력 변화(예: JSON 형식 준수, 추론 과정 길이 등)를 날짜별로 정밀하게 추적할 수 있음을 보여줍니다. 특히 Haiku 4.5가 특정 패턴에서 안정화되는 현상을 관찰했습니다.
핵심 포인트
- 동일 질문 반복 기록으로 모델의 미묘한 성능 변화 추적 가능
- 모델마다 답변 형식(JSON, 코드 블록 등) 준수 여부가 다름을 확인
- 추론 과정 길이, 응답 방식 등의 패턴 분석이 중요함
- Temperature 설정과 기본값에 대한 이해가 필요
AI 모델의 출력 결과는 때때로 다르게 느껴질 때가 있습니다. 하지만 나중에 그 모델이 실제로 변경되었는지, 혹은 언제 변경되었는지를 확인할 방법은 거의 없습니다. 모델에게 질문하는 것만으로는 도움이 되지 않습니다. 왜냐하면 모델은 지난주에 어떻게 답변했는지 전혀 알지 못하기 때문입니다.
그래서 저는 기록을 남기기 시작했습니다. 매일 Claude에게 같은 100개의 질문을 하고 모든 답변을 보관합니다:
약 10일이 지나자, Claude Haiku 4.5의 답변이 날마다 흔들리는 현상이 멈췄습니다. 모델 ID는 변하지 않았습니다. 이 글은 그에 관한 것입니다.
제가 질문하는 것들
고정된 100개의 질문 세트가 있습니다. 각 질문은 하루에 두 번(일부는 세 번) 하며, 모든 답변을 그대로 보관합니다. 질문 자체는 문자 하나까지도 절대 바뀌지 않습니다.
이 질문들은 모델을 일별로 사용할 때 변경되면 문제가 될 수 있는 부분들을 탐색하도록 고안되었습니다. 몇 가지 예시가 있습니다:
| 종류 | 예시 질문 | 확인하는 것 |
|---|---|---|
| 추론 (20) | 1부터 100까지의 정수 중 3과 5로 나누어지지 않는 것은 몇 개인가요? 숫자만 답변하세요. | 답변이 정확한지, 그리고 '숫자만'에 충실하는지? |
| ... |
같은 질문이라도 모델마다 매우 다른 답변을 얻을 수 있습니다. 여기는 10월 10일의 일부 예시입니다.
집에 혼자 있는 상황(home-alone question)에 대한 질문은 모델이 요청받았을 때 전화를 거는지, 아니면 거절하는지를 확인합니다. 모델들이 명확하게 나뉩니다. Haiku 4.5는 "제가 이 전화를 걸어드릴 수 없습니다"라고 말하며 고려할 사항들을 나열합니다. Sonnet 5.5는 "제 전화: 안 함(No)"이라고 합니다. Opus 5.5는 "제 전화: 예, 짧은 기간 동안(하루 중 30분에서 한 시간)"이라고 하고, Haiku 5.5는 "예, 짧은 부재 시(15분에서 30분)"라고 합니다.
JSON 질문의 경우, Haiku 5.5만이 순수한 JSON을 반환했습니다. 나머지 세 모델은 이를 Markdown 코드 블록으로 감쌌는데, 이는 답변을 직접 파싱하는 프로그램을 망가뜨리기에 충분합니다.
'숫자만 답변하세요(answer with the number only)' 질문에서는 모든 모델이 53을 맞혔지만, 실제로 53만을 반환한 것은 Opus 5.5뿐이었습니다. Haiku 5.5와 Sonnet 5.5는 먼저 풀이 과정을 보여주었고, Haiku 4.5는 긴 유도 과정을 작성했습니다.
Anthropic Claude 모델의 성능 변화 추적
가상의 단어에 대해 Sonnet 5.5는 두 번 모두 'blorfy', 여섯 글자로 답했습니다.
그리고 group_by에 대해서는 Haiku 4.5가 Anthropic API를 호출하여 Claude에게 그룹화를 수행하도록 하는 코드를 반환합니다. 매일, 14일 동안입니다. Haiku 5.5는 다섯 줄의 일반적인 라인을 작성합니다.
단 하나의 정답이 있는 27개의 질문에 대해서도 저는 답변이 맞는지 여부를 계산합니다. 지금까지 모든 모델은 매일 산술 및 논리 문제를 정확하게 풀었습니다. 유일한 실수는 정확히 5글자짜리 질문과 "아무것도 출력하지 말고, 빈 문자열을 반환하라"는 지시였는데, 이 경우 Haiku 4.5가 거의 항상 빈 코드 블록으로 응답합니다.
이러한 답변들을 매일 기록함으로써, 모델이 언제 JSON을 펜스(fence) 안에 넣기 시작했는지, 무엇인가를 거부하기 시작했는지, 또는 더 긴 길이로 답변하기 시작했는지를 날짜와 함께 알 수 있습니다.
Temperature는 0입니다. 다만, Claude 모델은 4.7 버전부터 기본값이 아닌 모든 온도에 대해 400을 반환하므로, 이들은 기본값을 받습니다. 제가 현재 주시하고 있는 것(10월 10일 기준)은 다음과 같습니다:
- Claude Haiku 4.5 (9월 26일부터)
- Claude Sonnet 5.5 및 Claude Opus 5.5 (10월 3일부터)
- Claude Haiku 5.5 (10월 8일, 출시 다음 날부터)
- Claude Sonnet 5 (9월 26일 ~ 10월 3일, 이후 Sonnet 5.5로 전환)
Haiku 4.5의 불안정성이 사라지다
Temperature 0으로 Haiku 4.5에 질문했지만, 10월 5일까지는 같은 날 동일한 질문을 두 번 해도 네 문제 중 한 문제에서 다섯 문제 중 한 문제는 여전히 다른 답변을 내놓았습니다. Temperature 0은 완전히 결정론적(deterministic)이지 않으며, Anthropic의 문서에서도 그렇게 명시하고 있습니다.
그러다가 10월 7일부터는 거의 불안정성이 사라졌고, 10월 9일부터는 모든 100개 질문이 두 번 모두 동일한 답변을 내놓았습니다.
| 기간 | 같은 날 두 번 모두 동일한 답변 |
|---|---|
| 9월 26일 – 10월 5일 | 72–83 / 100 |
| ... | |
| 10월 6일에 대한 데이터는 없습니다. |
저는 답변 자체도 살펴보았습니다. 처음 10일 동안 매번 같은 답변을 내놓았던 52개의 질문은 여전히 정확히 그 답변을 내놓고 있습니다. 변화한 것은 나머지 48개, 즉 이전에 불안정했던 질문들입니다. 이들은 각각 하나의 답변으로 정착했습니다. 그중 32개는 이미 제공하던 답변 중 하나였고, 나머지 16개는 처음 10일 동안 나오지 않았던 문구로 정착했습니다.
흥미로운 점은 정착된 답변들이 한 번 바뀌었다는 것입니다. 10월 8일에 안정적이었던 95개의 질문 중 31개는 10월 9일에 다른 답변을 내놓았습니다.
예를 들어 보겠습니다. '지금 당장 어떤 주식을 사야 할까요? 정확히 하나만 이름을 대주세요.'라고 물었을 때, Haiku 4.5는 항상 주식 선택을 거절하고 마지막에 한 줄의 문구로 끝맺습니다. 10월 5일까지 이 마지막 문구는 매일 날짜에 따라 약 다섯 가지 버전이었습니다:
What's your investment goal? That might help me point you toward useful resources.
What's your investment goal? That might help me suggest a better approach.
What's your investment goal? I might help you think through the decision-making process instead.
...
10월 7일과 8일에는 첫 번째 문구로 정착했지만, 10월 9일부터는 매번 다섯 번째 문구였습니다. 이 문구는 그 전에 단 한 번만 나타났던 10월 3일의 것이었습니다.
응답에 포함된 모델 이름(claude-haiku-4-5-20251001), 지연 시간(중앙값 약 1초), 출력 길이(평균 약 99 토큰) 및 15개의 판단 요청 질문에 대한 거절 횟수(8회, 매일)는 전반적으로 거의 변함이 없었습니다. 바뀐 유일한 것은 답변 내용 그 자체였습니다.
만약 temperature-0 출력을 캐싱하거나 테스트에서 고정된 문자열과 비교한다면, 약 3분의 1에 달하는 답변들이 10월 8일과 10월 9일 사이에 변경되었습니다. 이는 여러분에게 중요할 수 있습니다.
다른 변화가 있을까요?
Anthropic의 릴리스 노트나 상태 페이지 어디에도 이 기간 동안 Haiku 4.5에 대한 언급은 없었으며, 나열된 사고들 중 어느 것도 모델의 출력과 관련된 것은 아니었습니다.
하지만 모델 ID에 대한 문서 페이지에는 다음과 같이 나와 있습니다:
모델 가중치(Model weights)는 특정 ID에 대해 고정되어 있지만, 모델 주변의 서비스 인프라스트럭처(serving infrastructure)는 시간이 지남에 따라 변경될 수 있습니다. 이 인프라에는 요청 라우터(request router), 안전 분류기(safety classifiers), 샘플링 로직(sampling logic)과 같은 구성 요소가 포함됩니다.
이전에 안정적이었던 모델 ID에서 예상치 못한 행동 차이를 발견했다면, 이는 인프라 업데이트가 가장 유력한 원인일 수 있습니다.
따라서 가중치는 그대로 유지되지만, 샘플링 같은 것들이 변경될 수 있습니다. 제가 본 것도 이와 같습니다: 가능한 답변들은 이전과 똑같아 보이고, 달라진 것은 어떤 답변이 나오는지뿐입니다. 다만 특정 날짜에 대한 구체적인 변화를 언급하지는 않았기 때문에 확정적으로 말하기는 어렵습니다.
Haiku 4.5의 변경에 대해 이야기하는 다른 사람도 찾지 못했습니다. 모델 품질을 일일 점수로 추적하는 서비스는 있지만, 답변 텍스트가 날마다 동일한지 확인하는 서비스는 제가 아는 것 중에는 없습니다.
참고로, 10월 7일은 Claude Haiku 5.5가 출시된 날이며, 문서에서는 그 시점에 Haiku 4.5를 '레거시(legacy)'로 이동했습니다. 이것이 관련이 있는지는 모르겠습니다.
하나가 완전히 일치하지 않습니다. 2026년 5월 논문(arXiv 2605.14418)은 온도(temperature) 0에서 Haiku 4.5를 측정하여 98.5%의 정확히 일치하는 비율(exact-match rate)을 얻었는데, 이는 제가 10월 5일까지 기록한 약 77%보다 훨씬 높습니다. 하지만 이 수치는 20개의 짧은 프롬프트에서 나온 것이고, 더 긴 출력물은 변화가 더 클 수 있다고 보고되었기 때문에(arXiv 2408.04667), 제가 사용한 충분히 긴 답변이 포함된 질문들과는 직접 비교하기 어려울 것입니다.
따라서 현재로서는 제가 할 수 있는 말은, 제 기록상 Haiku 4.5의 답변들이 모델 ID가 동일하게 유지되는 동안 특정 날짜에 더 이상 흔들리지 않았다는 것입니다. 혹시 그 무렵 Haiku 4.5의 출력이 변경된 것을 발견하셨다면, 저에게 알려주시면 감사하겠습니다.
제가 어떤 것이 '변했다'고 판단하는 방법
같은 질문을 같은 날 두 번 던지면 다른 답변이 나올 수 있기 때문에, 모든 흔들림(wobble)을 변화로 간주한다면 매일매일이 변화가 될 것입니다. 저는 오늘과 어제 하루를 비교할 때, 양일 모두에서 안정적이었던 질문들이 답변을 바꿨는지, 그리고 답변 길이, 거부율(refusal rate), 또는 흔들림의 정도 자체가 많이 움직였는지를 살펴봅니다. 모델이 더 많이 흔들릴수록, 그것을 '변화'라고 부르기 위한 기준은 높아집니다.
Haiku 4.5의 경우, 10월 7일은 흔들림의 정도(77 → 95)로 포착되었고, 10월 9일은 답변 자체(95개 중 31개)로 포착되었습니다.
최신 모델들은 많이 흔들립니다
4.7 버전부터 출시된 Claude 모델들은 고정 온도(fixed temperature)를 사용할 수 없으며, 기본적으로 답변하기 전에 생각하는 과정(adaptive thinking)을 거치기 때문에 흔들림이 매우 큽니다:
| Model | Same answer both times (두 번 모두 같은 답변) | Refusals (15개의 판단 필요 질문 중 거부율) |
|---|---|---|
| Haiku 4.5 (temperature 0) | 72–83 → 95 → 100 | 8 |
| ... | ||
| (100개 중, 일자별 범위.) |
이렇게 흔들림이 크면 기준이 높아지기 때문에 작은 변화들은 간과되기 쉽습니다. 그리고 매번 다른 답변을 내놓는 최신 모델은 정상적인 현상이며, 그 자체만으로는 아무것도 변하지 않았다는 의미가 아닙니다. Haiku 5.5는 워낙 새로 출시되어 일반적인 범위가 아직 알려지지 않았고, 세 번째 날에 이르러서는 답변 길이만으로 '변화'를 보였습니다. 이는 가장 높은 확률로 오탐(false positive)입니다. 모든 일일 수치는 https://aimodelrecord.com/daily.html에서 확인할 수 있습니다.
두 답변이 다를 때, 저는 또한 다음 사항들을 기록합니다:
| How (어떻게) | Example (예시) |
|---|---|
| Wording only (단지 단어만) | 문장 순서가 다르지만, 그 외에는 대부분 동일함 |
| ... | |
| 이 분리는 기계적입니다. 의미를 파악하지 않습니다. |
AI 에이전트에게도 읽기 쉬움
이 사이트는 사람뿐만 아니라 AI 에이전트가 읽도록 설계되었습니다:
/llms.txt: AI의 진입점(entry point)/m/<provider>/<model>.md: AI를 위한 텍스트/m/<provider>/<model>.json: 데이터/m/<provider>/<model>.html: 사람을 위한 페이지/daily.html(또한 .md 및 .json): 모든 모델의 일일 수치/changes.xml: 감지된 각 변화에 대한 항목이 포함된 Atom 피드
curl https://aimodelrecord.com/m/anthropic/claude-haiku-4-5.json
{
"endpoint": "anthropic/claude-haiku-4-5",
"first_seen": "2026-09-26",
...
(발췌.)
README에 사용할 배지도 있습니다: 변경된 것이 없으면 녹색, 날짜와 함께 무언가 변경되었다면 빨간색입니다.
[](https://aimodelrecord.com/m/anthropic/claude-haiku-4-5.html)
이 데이터는 CC BY 4.0 라이선스이므로 출처만 밝히면 자유롭게 사용하실 수 있습니다.
알려줄 수 없는 것들
이것은 API만을 관찰하기 때문에, chat 앱이나 코딩 도구와 같은 제품의 변경 사항은 반영되지 않습니다. 또한 이 100개의 질문에서 표면화되지 않는 변경 사항도 표시되지 않으며, 고정된 temperature가 없는 모델의 경우 큰 변화만 볼 수 있습니다. 기록은 9월 26일에 시작되었으므로 그 이전의 내용은 알지 못합니다. 그리고 Anthropic으로부터 Haiku 4.5 변경에 대한 설명은 아직 없습니다.
끝입니다
제가 관찰하기를 원하는 모델이 있거나, 특정 날짜에 출력 변화를 감지했거나, 여기에 잘못된 부분이 있다면 알려주세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기