
왜 행동 데이터가 사용자 피드백보다 더 중요한가
요약
사용자의 긍정적인 인터뷰 피드백과 실제 행동 데이터 사이의 괴리를 분석하며, 제품-시장 적합성(PMF)을 판단할 때 정성적 피드백보다 정량적 행동 신호가 더 중요함을 강조합니다.
핵심 포인트
- 사용자의 언어적 피드백은 실제 사용 행동과 다를 수 있음
- 긍정적인 인터뷰는 제품의 방향성을 왜곡할 위험이 있음
- 행동 데이터는 수익 지표보다 먼저 PMF를 보여주는 핵심 신호임
- 온보딩 마찰 및 이탈률 등 실제 사용 데이터를 우선시해야 함
내부적으로는 마치 모멘텀(momentum)이 붙은 것처럼 느껴졌습니다. 사용자들은 활발하게 활동했고, 인터뷰 피드백은 긍정적으로 들렸으며, 기능 요청(feature requests)은 시장이 제품을 앞으로 끌어당기고 있다는 인상을 줄 만큼 빠르게 쌓여갔습니다.
상업적으로는, 그 밑바탕에서 제대로 복리로 쌓이고 있는 것이 거의 없었습니다.
사용자들은 온보딩(onboarding) 과정에서 어려움을 겪었고, 테스트 후 사라졌으며, 장기적인 리텐션(retention)이나 의미 있는 수익으로 전환되는 경우는 드물었습니다. 행동 신호(behavioural signal)와 인터뷰 피드백는 완전히 다른 두 가지 현실을 설명하고 있었습니다.
이러한 모순은 그 어떤 성장 대시보드(growth dashboard)보다도 제품-시장 적합성(product-market fit)에 대해 더 많은 것을 가르쳐 주었습니다.
저는 AI 음성 플랫폼의 초기 상업적 움직임을 제로 상태에서 구축하고 있었습니다. 베타 사용자 확보, 온보딩 실패 진단, 획득 전략 수립, 구독 전환, 그리고 비즈니스가 스텔스(stealth) 상태를 유지하는 동안 나중에 2,000억 달러 규모의 통신사를 통해 엔터프라이즈 유통을 확보하게 된 B2C2B 상업 전략을 구축하는 일을 수행했습니다.
기술은 작동했지만, 실제로 누가 그것을 필요로 하는지에 대한 상업적 가정은 틀렸습니다.
사용자가 말한 것과 사용자가 한 행동은 서로 다른 것이었다
스타트업에 관한 가장 큰 신화 중 하나는 초기 사용자들이 자신들이 생각하는 바를 정확히 말해준다는 것입니다.
대부분은 그렇지 않습니다.
특히 사용자들이 자신들이 테스트하고 있는 시스템을 실제 사람들이 활발하게 구축하고 있다는 것을 알고 있는 AI 제품의 경우 더욱 그렇습니다.
사용자들이 테스트 그룹 내에서 몇 주를 보내게 되자, 피드백은 눈에 띄게 부드러워졌습니다. 특히 보상이 개입되어 있을 때, 실제 사람들이 만들고 있다는 것을 알고 있는 것에 대해 지나치게 부정적으로 보이고 싶어 하는 사람은 아무도 없었습니다.
직접적인 피드백은 믿기지 않을 정도로 긍정적이었습니다:
“이거 정말 멋지네요.”
“당신들이 만들고 있는 것이 정말 마음에 들어요.”
“정말 흥미롭네요.”
그 후 저는 인터뷰 노트와 온보딩 이후에 실제로 일어난 일을 비교하기 시작했습니다.
한 사용자는 저에게 제품이 얼마나 기대되는지 말하는 데 20분을 소비했고, 같은 대화 중에 몇 가지 추가 기능도 요청했습니다.
하지만 그들은 설정을 단 한 번도 완료하지 않았습니다.
또 다른 사용자는 제품을 "미래"라고 묘사하며 친구를 테스트 그룹에 추천하기도 했습니다.
하지만 그들은 2주 안에 사라졌습니다.
처음에는 단순히 기능이 더 필요하다고 생각했습니다. 하지만 이러한 패턴이 무시하기 어려울 정도로 자주 반복되었습니다.
인터뷰 노트는 고무적으로 보였지만, 사용 데이터(usage data)는 그렇지 않았습니다.
긍정적인 피드백 대화와 이탈 보고서(churn reports)에 동일한 이름들이 계속해서 등장했습니다. 그때 저는 인터뷰와 행동(behaviour)이 서로 다른 두 가지 현실을 설명하고 있다는 것을 처음으로 깨달았습니다.
유료 베타 사용자들은 온보딩 마찰(onboarding friction), 설정 실패(setup failures), 대화 문제(conversational issues), 그리고 활성화 차단 요소(activation blockers)를 식별하는 데 여전히 매우 유용했습니다. 하지만 어느 시점에 도달하면, 유료 테스트는 제품의 방향을 왜곡하기 시작합니다. 왜냐하면 기업은 자연스럽게 운영상의 의존성(operational dependency) 대신 감정(sentiment)을 중심으로 최적화하기 시작하기 때문입니다.
행동 신호(Behavioural signals)는 수익 대시보드(revenue dashboards)가 보여주기 훨씬 전부터 약한 제품 시장 적합성(product market fit)을 드러냅니다. 대부분의 팀은 초기 수치가 여전히 흥미로워 보인다는 이유로 이를 단순히 무시합니다.

Voice AI 내부에서 이를 더욱 어렵게 만든 것은 피드백이 얼마나 **사회적 영향(socially influenced)**을 받게 되었는가 하는 점이었습니다.
한 사용자는 몇 주 동안 제품을 적극적으로 사용하며 피드백을 제공하고 새로운 기능을 지지했습니다. 하지만 친구가 "로봇과 대화하는 것"이라는 아이디어에 부정적으로 반응한 후, 그들의 열정은 거의 하룻밤 사이에 사라졌습니다. 시간이 흐르면서 그들은 AI와 상호작용을 덜 하게 되었고, 다른 사람들에게 사용을 권장하는 것도 그만두었으며, 결국 가까운 지인들이 더 이상 AI와 상호작용할 필요가 없도록 설정을 변경했습니다.
이는 수십 년간의 기술 수용 연구와 밀접하게 일치합니다. 기술 수용 모델 (TAM, Technology Acceptance Model)과 UTAUT 프레임워크 모두 사회적 친숙도, 신뢰, 그리고 인지된 수용성(perceived acceptance)이 사용자가 새로운 기술을 계속 채택할지 여부에 중대한 영향을 미친다는 것을 일관되게 보여줍니다.
대부분의 팀은 여전히 채택(adoption)을 주로 기술적인 과제로 규정합니다.
실제로 사회 심리학은 시스템 역량보다 훨씬 더 이른 시점에 장벽이 됩니다.
시장은 실제로 우리 자신보다 제품을 더 명확하게 정의했습니다.
내부적으로 우리는 이것을 AI 어시스턴트 (AI assistant)라고 불렀습니다.
하지만 사용자들은 계속해서 이를 “AI 음성 사서함 (AI voicemail)”이라고 불렀습니다.
처음 몇 번 그 소리를 들었을 때, 저는 그들을 교정해 주었습니다. 그것이 제품이 대화적으로 실제로 수행하고 있는 기능들을 지나치게 단순화하는 것처럼 느껴졌기 때문입니다.
그런데 그런 일이 계속 반복되었습니다.
같은 설명을 반복해서 듣게 된 후, 저는 그것을 오해로 취급하는 것을 멈추고 사람들이 왜 그것을 사용하는지에 주목하기 시작했습니다.
분명해진 사실은, 이를 AI 음성 사서함이라고 설명하는 사용자들은 가치 제안 (value proposition)을 거의 즉각적으로 이해했다는 점입니다. 반면 “AI 어시스턴트”라는 말을 들은 사용자들은 왜 그것에 관심을 가져야 하는지, 혹은 어떻게 가치를 창출할 수 있는지 이해하기까지 종종 추가적인 설명이 필요했습니다.
시장이 우리를 위해 카테고리를 단순화해 준 것입니다.
처음에 제가 덜 정교한 설명이라고 생각했던 것이 실제로는 온보딩 마찰 (onboarding friction)을 줄여주고 있었습니다. 사용자들은 몇 초 만에 그 이점을 이해할 수 있었습니다.
그 변화는 채택 (adoption)을 실질적으로 개선했습니다.
이러한 패턴은 성공적인 제품들에서 반복적으로 나타납니다. 사용자들은 종종 기업보다 먼저 실제 사용 사례 (use case)를 발견합니다. Instagram도 Burbn 시대에 유사한 경험을 했습니다. 원래의 제품은 체크인, 게임 메커니즘, 위치 공유, 사진 공유를 묶어 제공했으나, 행동 사용 패턴 (behavioural usage patterns)을 통해 사용자들이 압도적으로 한 가지, 즉 사진을 위해 돌아온다는 사실이 밝혀졌습니다. 회사는 다른 모든 것을 제거하고 사용자들이 자연스럽게 반복하는 행동을 중심으로 제품을 재구축했습니다.
Slack은 완전히 다른 게임 방향성을 위해 구축되었던 내부 커뮤니케이션 시스템에서 탄생했습니다. 시장은 창업자의 원래 내러티브 (narrative)에 보상하는 경우가 드뭅니다. 시장은 사용자가 자연스럽게 채택하는 워크플로 (workflow)에 보상합니다.
사용자들이 동일한 워크플로로 돌아오고, 설정 마찰을 극복하며, 다른 사용자를 추천하거나, 광범위한 설득 없이 결제할 때마다, 그들은 그 어떤 인터뷰 답변보다 제품 시장 적합성 (product market fit)에 대해 더 많은 것을 드러내고 있었습니다.
행동은 의견보다 더 신뢰할 수 있게 확장됩니다.
찬탄은 의존성이 아니다
이 패턴은 온보딩 (onboarding) 통화 중에 처음 나타났습니다.
어떤 사용자들은 전달 (forwarding) 문제에 부딪히면 그대로 사라졌습니다. 반면 다른 이들은 동일한 문제를 완전히 다르게 다루었습니다.
한 부동산 중개인은 전달 설정이 올바르게 구성될 때까지 며칠에 걸쳐 여러 번 다시 전화를 걸었습니다.
한 법률 전문가는 상담을 놓치는 것이 실제 재정적 손실로 이어질 수 있었기에, 설정을 해결하는 데 거의 30분을 소비했습니다.
건설 및 자동차 관련 기업들은 일반 사용자들이 이탈하게 만든 것과 동일한 온보딩 문제를 뚫고 나아갔습니다.
반면, 동일한 마찰 (friction)을 겪은 개인 사용자들은 단순히 제품 사용을 중단했습니다.
제품은 변하지 않았습니다.
전화를 놓쳤을 때의 비용이 변했을 뿐입니다.
해당 사용자들에게 전화를 놓친다는 것은 다음과 같은 의미였습니다:
• 잠재 고객 (lead) 상실
• 예약 상실
• 상담 상실
• 계약 상실
이것이 진정한 PMF (product market fit) 신호가 되었습니다.
진정한 고객은 "전화를 받는 사람"이 아니었습니다. 전화를 놓쳤을 때 측정 가능한 상업적 손실이 발생하는 사람이었습니다.
ICP (Ideal Customer Profile, 이상적 고객 프로필)가 적절히 좁혀지자, 로드맵 우선순위 지정 (roadmap prioritisation)이 극적으로 쉬워졌습니다.
초기 사용자들은 모든 것을 원했습니다:
• 캘린더 연동 (calendar integrations)
• CRM 동기화 (CRM syncing)
• 고급 대화형 워크플로우 (advanced conversational workflows)
• 이메일 연동 (email integration)
• 문자 연동 (text integrations)
그 요청 중 일부는 결국 중요해졌습니다. 하지만 대부분은 아직 중요하지 않았습니다.
ICP가 명확하지 않으면, 모든 기능 요청이 전략적으로 중요하게 들립니다.
ICP가 명확해지면, 우선순위 지정은 훨씬 더 절제된 방식으로 이루어집니다:
• 이것이 마찰 (friction)을 줄이는가?
• 이것이 응답성 (responsiveness)을 개선하는가?
• 이것이 워크플로우 의존성 (workflow dependency)을 심화시키는가?
• 이것이 측정 가능한 운영 가치 (operational value)를 창출하는가?
그렇지 않다면, 보류합니다.

워크플로우 의존성이 자연스럽게 형성되자 리텐션 (retention)이 개선되었고, 추천 (referrals)이 증가했으며, 가격 책정 (pricing) 논의가 쉬워졌고, 사용이 습관화되었습니다.
사용자들은 제품을 실험처럼 다루는 것을 멈추고 운영 행동 (operational behaviour)의 일부로 통합하기 시작했습니다.
그 차이는 기능에 대한 흥분보다 훨씬 더 중요했습니다.
온보딩 마찰(Onboarding friction)은 인터뷰보다 더 빠르게 잘못된 시장을 드러냈다
가장 명확한 초기 경고 신호 중 하나는 온보딩(onboarding)에서 나타났습니다.
사용자들은 앱을 다운로드한 뒤, 며칠 후 전달(forwarding) 설정을 제대로 할 수 없다며 저에게 연락해 왔습니다. 통신사(carrier) 간의 불일치 문제가 반복적으로 드러났습니다. 사용자들은 의미 있는 가치를 실현하기도 전에 이탈했습니다.
대부분의 기업은 이를 고객 지원 비용(support overhead)으로 분류했을 것입니다.
저는 이를 상업적 누수(commercial leakage)로 취급했습니다.
그래서 저는 이를 운영적(operationally)으로 접근했습니다.
저는 통신사 시스템 전반에 걸친 전달(forwarding) 동작을 매핑하고, 매장을 방문하고, 통신사 지원 팀에 전화하며, 불일치가 나타나는 곳마다 문제를 제기했습니다. 목표는 단순했습니다. 사용자가 제품을 포기하기 전에 마찰(friction)을 제거하는 것이었습니다.
온보딩 문제를 더 많이 조사할수록, 그 패턴을 무시하기가 점점 더 어려워졌습니다. 응답성에 따라 수익이 결정되는 사용자들은 마찰을 뚫고 계속 나아갔습니다. 단순히 호기심을 가진 사용자들은 거의 그러지 않았습니다.
그 차이가 온보딩에 대한 제 생각을 완전히 바꾸어 놓았습니다.
만약 설정 과정에서 광범위한 수동 지원(hand-holding)이 필요하다면, 당신은 대개 아직 제품-시장 적합성(product-market fit)을 확보하지 못한 상태입니다. 당신은 '지원된 채택(assisted adoption)'을 하고 있는 것입니다.
대부분의 스타트업은 운영적 마찰(operational friction)을 줄이기 전에 미학적인 요소에 과도하게 투자합니다. 사용자들이 가치에 도달하기도 전에 여전히 이탈하고 있는 동안, 그들은 인터페이스를 재설계하고, 애니메이션을 개선하며, 브랜딩을 최적화하고, 흐름(flow)을 다듬습니다.
UX(사용자 경험)가 먼저였고, 그다음이 UI(사용자 인터페이스)였습니다. 그것이 가끔 사람들을 좌절시키기도 했지만, 여전히 올바른 상업적 결정이었습니다.
증거를 중심으로 구축하기
결국 저는 주로 인터뷰에 의존하는 것을 멈추고, 대신 실제 사용(live usage)을 기반으로 한 행동 분석(behavioural analysis) 시스템을 구축하기 시작했습니다.
스타트업 단계에서는 인프라가 전혀 존재하지 않았기에, 초기 피드백 루프(feedback loops)를 수동으로 구축했습니다. 원래는 열정적인 사용자들이 왜 계속 사라지는지 이해하려고 노력하던 과정에서 통화 내용을 검토하는 것부터 시작했습니다.
인터뷰 피드백은 압도적으로 긍정적이었지만, 리텐션(Retention, 유지율)은 여전히 불안정했습니다. 성숙한 분석 인프라(Analytics infrastructure)가 없는 상황에서 무슨 일이 일어나고 있는지 이해하는 가장 빠른 방법은 상호작용(Interactions)을 직접 검토하는 것이었습니다.
사용자의 허가를 받아, 저는 수천 건의 통화, 중단(Interruptions), 전사 데이터(Transcripts), 망설임 패턴(Hesitation patterns), 실패한 전환(Failed transfers), 대화 중단 지점(Conversational drop-off points), 그리고 발신자의 반응을 검토하고 분류했습니다.
저는 다음과 같은 사항을 식별하기 위해 대화 전반에 걸쳐 상호작용 태깅(Interaction tagging)을 도입했습니다:
• 중단 처리 실패 (Interruption handling failures)
• 어색한 속도 (Awkward pacing)
• 잘못된 이름 사용 (Incorrect name usage)
• 발신자의 좌절 (Caller frustration)
• 성공적인 리드 확보 (Successful lead capture)
• 대화의 지속 (Conversational continuation)
• 리텐션과 연결된 행동 (Retention-linked behaviours)
이는 주관적인 피드백이 했던 것보다 훨씬 빠르게 우선순위를 변화시켰습니다. 왜냐하면 관찰 가능한 행동(Observable behaviour)을 통해 운영상에서 신뢰가 어디서 무너지는지를 드러내 주었기 때문입니다.
로드맵은 다음과 같은 방향으로 전환되었습니다:
• 온보딩(Onboarding) 축소
• 중단 처리 (Interruption handling)
• 대화 속도 (Conversational pacing)
• 커스터마이징 (Customisation)
• 상호작용 초기 몇 초간의 마찰(Friction) 감소
사용자들은 종종 AI가 "덜 로봇 같기를" 원한다고 말했습니다.
하지만 그들이 실제로 유지(Retain)하고자 했던 것은 운영 레버리지(Operational leverage)였습니다.
감정적 계층(Emotional layer)은 신뢰를 가속화했고, 워크플로 계층(Workflow layer)은 **의존성(Dependency)**을 만들어냈습니다.
대부분의 AI 팀은 여전히 성공적인 출력(Outputs)을 최적화하는 데 집중하고 있습니다. 하지만 사용자는 출력이 중요해지기 훨씬 전부터 해당 상호작용을 신뢰할지 여부를 결정합니다.
사용자 피드백을 신뢰하기 전에 제가 측정하는 네 가지 행동 신호
도입(Adoption)을 평가할 때, 저는 이제 거의 모든 것보다 다음 네 가지 신호를 우선시합니다:
1. 도움 없는 활성화 (Activation without assistance)
사용자가 광범위한 가이드 없이도 가치에 도달할 수 있는가?
2. 반복적인 워크플로 사용 (Repeat workflow usage)
동일한 문제가 발생했을 때 사용자가 자연스럽게 돌아오는가?
3. 지불 의사 (Willingness to pay)
제품이 비용을 지불할 만큼 충분히 중요한 문제를 해결하는가?
4. 운영 의존성 (Operational dependency)
제품이 있을 때보다 없을 때 워크플로를 수행하기가 더 어려워지는가?
인터뷰는 행동을 설명하는 데 도움을 줍니다.
제품 결정을 내릴 때는 의견(Opinion)보다 행동(Behaviour)이 더 비중 있게 다뤄져야 합니다.
가장 강력한 PMF (Product-Market Fit) 신호는 결코 칭찬이 아니었습니다.
그것들은 다음과 같았습니다:
• 도움 없이 이루어지는 활성화 (activation)
• 반복적인 워크플로우 (workflow) 사용
• 인센티브 없는 리텐션 (retention)
• 유기적인 추천 (organic referrals)
• 빠른 결제 의사 (willingness to pay)
• 운영상의 의존성 (operational dependency)
행동이 다르게 증명하기 전까지 그 외의 모든 것은 노이즈 (noise)였습니다.
사용자 인터뷰 (User interviews)는 여전히 중요하며, 사용자들이 무엇을 경험하고 있는지 설명하는 데 도움을 줍니다.
행동은 사용자들이 실제로 무엇을 가치 있게 여기는지 알려줍니다. 만약 두 가지가 일치하지 않는다면, 행동을 먼저 신뢰하십시오. 그것이 보통 진짜 로드맵 (roadmap)이 숨겨져 있는 곳입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Hacker Noon AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기