
AI 컴패니언 연속성(Continuity)을 위한 재현 가능한 테스트
요약
AI 컴패니언의 성능을 단순 스크린샷이 아닌 재현 가능한 프로토콜로 테스트하는 방법을 제안합니다. 정체성 안정성, 수정 처리, 관련 정보 회상 등 6가지 핵심 행동 지표를 통해 AI의 연속성을 정밀하게 측정합니다.
핵심 포인트
- 단순 답변 캡처가 아닌 재현 가능한 테스트 프로토콜의 필요성 강조
- 정체성, 수정 처리, 정보 회상 등 6가지 세부 측정 지표 정의
- 허구의 시나리오를 활용한 체계적인 테스트 프롬프트 구성법 제시
- 수정 사항 반영 및 문맥 유지 능력을 검증하는 단계별 절차 안내
AI 컴패니언 비교는 종로히 인상적인 답변 하나를 캡처한 스크린샷에 의존하는 경우가 많습니다.
그것은 취약한 테스트입니다.
어려운 행동은 나중에 나타납니다: 수정(correction) 이후, 어조(tone)의 변화, 장면 전환(scene transition), 또는 대화로의 복귀 이후에 말이죠. 저는 개인 정보를 공유하거나 주관적인 "느낌(vibes)"에만 의존하지 않고 누구나 반복할 수 있는 작은 프로토콜을 원했습니다.
그 결과가 아래의 연속성 테스트(continuity test)입니다.

테스트가 측정하는 것
이 프로토콜은 종종 "기억(memory)"이라는 이름 아래 잘못 묶이곤 하는 여섯 가지 행동을 분리합니다:
- 정체성 안정성 (Identity stability) — 캐릭터가 자신의 역할과 목소리를 유지하는가?
- 수정 처리 (Correction handling) — 새로운 사실이 기존의 사실을 대체할 수 있는가?
- 관련 정보 회상 (Relevant recall) — 시스템이 프로필을 통째로 쏟아내지 않고 유용한 세부 정보를 검색하는가?
- 불확실성 행동 (Uncertainty behavior) — 증거가 부족할 때 질문을 던지는가?
- 장면 진행 (Scene progression) — 나중의 장면이 이전의 결정에 의존할 수 있는가?
- 사용자 제어 (User control) — 사용자가 시스템과 싸우지 않고 상호작용을 재지정할 수 있는가?
테스트 프롬프트
실제 개인 데이터 대신 허구의 시나리오를 사용하세요:
우리는 매주 목요일 조용한 루프탑 온실에서 만납니다. 당신은 야간 관리자입니다. 바질 식물의 이름은 Harbor입니다. 나는 재촉당하는 것을 싫어합니다. 나는 짧은 편지를 완성하려고 노력 중이지만 오늘 밤에 보내고 싶지는 않습니다. 대화를 따뜻하고, 구체적이며, 서두르지 않게 유지하세요.
이 프롬프트는 다음을 포함합니다:
- 하나의 반복되는 시간;
- 하나의 장소;
- 하나의 이름이 붙은 사물;
- 하나의 상호작용 선호도;
- 하나의 미결된 목표.
테스트 절차
1단계: 베이스라인 (Baseline)
설정을 반복하지 않고 10~15회 정도 대화를 이어가세요. 캐릭터가 세부 사항을 자연스럽게 사용하는지 확인하십시오.
단순한 반복을 좋은 기억력으로 점수화하지 마십시오. "우리는 Harbor와 함께 옥상 온실에 있다"라는 문장은, 서두르지 말라는 선호도를 존중하는 행동보다 유용성이 떨어집니다.
2단계: 수정 (Correction)
다음과 같이 말하십시오:
바질 식물의 이름을 바꿨어. 이제 Harbor가 아니라 Marlowe야.
몇 차례 대화를 이어가십시오.
실패 사례 (Failure modes):
- 이전 이름과 새 이름이 혼용됨;
- 시스템이 두 이름 모두 항상 옳았다고 말함;
- 수정 사항이 모든 답변에서 부자연스럽게 반복됨;
- 수정 사항이 관련 없는 문맥을 대체함.
3단계: 어조 변화 (Tone change)
다음과 같이 말하십시오:
지금은 좀 더 장난치고 싶지만, 여전히 편지를 보내고 싶지는 않아.
캐릭터는 해결되지 않은 목표를 유지하면서 어조를 조정해야 합니다.
4단계: 장면 전환 (Scene transition)
대화의 장소를 옮기십시오:
온실을 떠나 아래층으로 내려가자. 편지는 챙기되, Marlowe는 그대로 둬.
새로운 장면이 이전의 모든 세부 사항을 답변에 끌고 오지 않으면서도, 관련 사실들을 보존하는지 확인하십시오.
5단계: 나중에 돌아와 확인하기 (Return-later check)
제품이 지속적인 대화 (Persistent conversations)를 지원한다면, 나중에 돌아와 다음과 같이 질문하십시오:
지난번에 우리가 해결하지 못한 게 뭐였지?
훌륭한 응답은 편지를 식별하고, 편지가 이미 보내졌다고 주장하는 것을 피하며, 설정된 적 없는 세부 사항에 대해 적절한 불확실성을 표현해야 합니다.
권장 채점 기준 (Suggested scoring rubric)
각 카테고리에 대해 0점에서 2점까지 점수를 매기십시오:
| 카테고리 | 0 | 1 | 2 |
|---|---|---|---|
| 정체성 (Identity) | 심각한 이탈 (major drift) | 미미한 이탈 (minor drift) | 안정적이고 자연스러움 (stable and natural) |
| ... |
결과를 하나의 "최고의 AI 컴패니언" 점수로 통합하지 마십시오. 사용자마다 중요하게 생각하는 카테고리가 다릅니다.
중요한 한계점 (Important limitations)
- 하나의 시나리오가 모든 상호작용 스타일을 측정할 수는 없습니다.
- 제품 업데이트가 결과(results)를 변경할 수 있습니다.
- 커뮤니티 주도 플랫폼(community-driven platforms)에서는 개별 캐릭터가 다르게 행동할 수 있습니다.
- 더 긴 컨텍스트 윈도우(context window)가 자동으로 더 나은 수정 처리(correction handling)를 생성하는 것은 아닙니다.
- 설득력 있는 답변이라도 여전히 허구의 역사(invented history)를 포함할 수 있습니다.
- 단순히 기억력을 테스트하기 위해 민감한 개인 정보(sensitive personal facts)를 절대 사용하지 마세요.
프로토콜을 공개하는 이유 (Why publish the protocol?)
재사용 가능한 테스트는 제품에 대한 논의를 더욱 유용하게 만듭니다. 이를 통해 독자들은 관찰 내용을 비교하고, 실패 모드(failure modes)를 식별하며, 제품 설계와 마케팅 주장(marketing claims)을 구분할 수 있습니다.
만약 이 프로토콜을 시도한다면, 어떤 카테고리가 가장 먼저 실패했는지, 그리고 그 실패가 즉시 발생했는지 아니면 나중에 다시 돌아온 후에 발생했는지를 공유해 주세요.
소속 및 AI 지원 공개 (Affiliation and AI-assistance disclosure): 저는 연속성(continuity)이 저희가 연구하는 제품 문제 중 하나인 LumiChat 팀과 함께 일하고 있습니다. 이 게시물은 제품 추천이 아닌, 특정 업체에 치우치지 않은(vendor-neutral) 테스트 방법론입니다. AI 도구는 편집과 구조화에 도움을 주었으며, 시나리오, 루브릭(rubric), 한계점 및 최종 주장은 저자가 직접 검토했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기