어떤 소프트웨어를 만들어야 할지 예측하는 방법은 없다: 3년간의 스토어 데이터를 이용한 백테스팅
요약
본 글은 소프트웨어 기회를 예측하는 방법이 없음을 강조하며, 3년간의 스토어 데이터를 이용해 AI 에이전트가 미충족 니즈를 분석한 결과를 공유합니다. 아무리 좋은 프레임워크도 성공을 보장할 수 없으며, 실제 검증만이 유효함을 역설합니다.
핵심 포인트
- 소프트웨어 기회 예측은 불가능하며, 스스로 테스트해야 한다.
- AI 에이전트가 스토어 데이터를 분석했으나, 개발 가치가 있는 항목은 매우 적었다.
- 기존의 성공 프레임워크(Outcome-Driven Innovation 등)도 통계적 근거에 의문을 제기한다.
- 신제품 성공의 가장 강력한 상관관계는 제품 우위성이다.
업데이트, 10월 9일: 저는 이것을 9월 29일에 작성했습니다. 첫 번째 백테스트(backtest)는 10월 1일에 완료되었습니다. 한 시그널은 처음에는 무작위 대비 13배 더 좋아 보였습니다. 같은 크기의 필요와 비교했을 때는 약 2배였고, 더 세밀한 크기 대역에서는 추정치로 1.4~1.6배였으며, 이것은 인샘플(in-sample) 데이터이므로 실제보다 높을 가능성이 있습니다. 어떤 시그널이 실제로 작동할지는 앞으로의 검증이 필요합니다. 한 시그널("Missing Here")은 10월 1일에 관찰 전용(watch-only)으로 이동되었습니다. 원래 Medium에 게시된 내용입니다.
이제 AI를 사용해 오후 만에 Chrome 확장 프로그램(Chrome extension)을 만들 수 있습니다. 더 이상 구축 자체가 병목 현상이 아닙니다. 무엇을 만들어야 하는지 아는 것이 중요합니다.
저는 공개 실험을 진행하고 있습니다. 미충족 니즈(unmet needs)를 가진 공공 스토어 데이터를 가지고 AI에게 각 항목이 개발할 가치가 있는지 연구하게 하고, 좋은 것들은 AI가 구축하게 한 뒤, 놓친 결과까지 모든 결과를 출판하는 것입니다. 일주일 만에 저는 이 모든 질문의 밑바닥에 있는 의문을 마주했습니다: 도대체 누가 "이것을 만들어야 한다"는 판결을 신뢰할 수 있을까?
그래서 저는 소프트웨어 기회를 포착하는 방법에 대해 찾을 수 있는 모든 것을 읽었습니다. 요약하자면 다음과 같습니다:
어떤 방법도 무엇을 만들지 예측한다고 독립적으로 입증된 바가 없습니다. 빌릴 수 있는 것은 기회에 대한 설명 어휘와 성공의 몇 가지 강력한 상관관계뿐입니다. 특정 시그널이 작동하는지 여부는 스스로 테스트해야 합니다.
저를 겸손하게 만든 실험
인기 있는 플레이북(playbook)은 다음과 같습니다: 사용자가 여전히 남아있는 폐기되었거나 제거된 확장 프로그램을 찾아 재구축하는 것입니다. 사람들은 이러한 목록을 판매합니다.
저희는 상위 100개 점수 후보들을 가져와 AI 에이전트(AI agent)에게 웹에서 각각에 대해 연구하도록 했습니다:
- 개발할 가치가 있는 것은 0개였습니다. 34개는 "조건부로 가능성 있음", 66개는 아니었습니다.
- 90개는 이미 더 좋고 유지되는 대안이 있었습니다.
- 66개는 축소되거나 사라진 니즈를 충족했습니다.
- 상위 30개의 40%가 "가능성 있음"이었던 반면, 61~100위권의 28%였습니다—겨우 조금 나을 뿐이었고, 명확하게 '예'라고 할 수 있는 것은 하나도 없었습니다. 점수가 보이는 것보다 훨씬 적은 의미를 가졌습니다.
폐기되었다는 것은 보통 이유가 있어서 폐기되었다는 뜻입니다. 목록은 무엇이 고장 났는지 알려줄 뿐이며, 그것을 고칠 가치가 있는지 여부는 검증만이 알려줍니다.
인기 있는 프레임워크들은 기회를 잘 설명하지만, 예측하지는 못합니다
- **결과 중심 혁신(Outcome-Driven Innovation)**은 좋은 정의("중요하지만 충분히 다뤄지지 않은 결과")를 제공합니다. 이 이론의 유명한 86% 성공률은 해당 공급업체의 자체 고객 프로젝트 21건에서 나온 것입니다.
- 파괴적 혁신(Disruptive innovation): 원본 작업에서 인용된 77가지 사례에 대한 재검토 결과, 단지 9%만이 이론의 네 가지 요소를 모두 충족하는 것으로 나타났습니다.
- "타이밍이 가장 중요하다(Timing matters most)": 널리 인용되는 42%는 창업자가 결과를 알고 난 후 직접 200개 회사를 평가하여 얻은 수치입니다.
- 인디 해커의 지혜(계단식 접근, 청중 우선, "70개 이상의 프로젝트 중 4개가 수익을 창출했다")는 진정으로 유용하며 — 대부분 스스로 보고한 것입니다.
실질적인 통계적 근거를 가진 것은 두 가지입니다:
- 233개 연구에 대한 메타 분석(meta-analysis): 신제품 성공의 가장 강력한 상관관계는 **제품 우위성(product advantage)**입니다 (상관 계수 .34, 해당 메타 분석에서 가장 높은 수치). 샘플은 주로 제조 및 B2B 분야이므로, 이것이 소규모 인디 소프트웨어에 적용될 수 있는지는 미지수입니다.
- 116개 스타트업을 대상으로 한 무작위 대조 시험(randomized trial): 아이디어를 반증 가능한 가설로 다루도록 훈련받은 창업자들이 더 나은 성과를 보였고 피벗할 의향도 더 높았습니다. 실제 이점은 잘못된 양성(false positives)을 제거하는 것입니다.
그리고 저는 "스토어 데이터에서 아이디어를 선택 → 수익 창출"이라는 검증된 사례를 단 하나도 찾지 못했습니다.
기본 비율(Base rates)의 잔혹함
- 구독형 앱 중 17.2%가 1년 이내 월 $1K에 도달하며, 3.5%가 월 $10K에 도달합니다.
- 중앙값 크롬 확장 프로그램은 사용자 수가 17명이며, 약 70%는 100명 미만입니다.
- 크롬 확장 프로그램의 약 60%는 대략 1년 동안 유지되며; 잠재적으로 침해하는 확장 프로그램 중 86%는 삭제된 것들의 거의 복제품입니다.
따라서 저는 무작위 선택이 5–20% 정도의 확률에 도달한다고 추정합니다. 임의 기준선과 비교하지 않고 성공률을 보고하는 모든 방법은 아무것도 알려주지 않습니다.
우리가 나아갈 방향
세 가지 계층 구조와 별도의 "필요(need)" 객체입니다 (신호는 실시간이며, 차원 및 형식은 설계 중입니다).
- 신호(Signals) — 여기서 공백이 있는 이유는 무엇인가? 시험 중인 7가지 요소: 이탈 사용자(Abandoned Users), 리더 불만 사항(Leader Complaints), 불공정 가격 책정(Unfair Pricing), 수요 증가(Rising Demand), 서비스가 부족한 웹사이트(Underserved Website), 리더의 변화(나빠짐, 인수됨, 광고 추가, 가격 인상, 평점 하락), 그리고 여기에 없음(사람들이 다른 스토어에서 사용함; Chrome에는 유사한 것이 전혀 없음).
- 차원(Dimensions) — 가치가 있는가? (추가될 내용) 크기(Size), 지불 의사(willingness to pay), 제품 우위(product advantage), 구축 난이도(build difficulty), 확보 난이도(acquisition difficulty), 적절한 시기(timing), 증거 강도(evidence strength).
- 형식(Form) — 무엇을 출시할 것인가? (설계 중) 단일 도구, 작은 니즈들의 묶음(bundle of small needs), 템플릿, 또는 다른 무언가로 이어지는 깔때기(funnel).
초기 학습 덕분에 '니즈'는 스스로 살아남는다: 30,000개의 확장 프로그램 중 기회의 단위는 확장 프로그램이 아니라 니즈이다. 하나의 니즈에는 종종 수십 개의 확장 프로그램이 존재하며, 오래된 것들은 사라지고 사용자들은 이미 다른 곳으로 이동했다.
모든 '만들어라'라는 제안은 또한 **가장 위험한 가정(riskiest assumption), 가장 저렴한 테스트(cheapest test), 그리고 손절매 라인(stop-loss line)**과 함께 출시될 것이다. 이는 무작위 실험을 통해 얻은 우리의 실질적인 교훈이다.
백테스팅 이유
어떤 이론도 예측하는 것으로 입증된 바가 없다면, 역사를 상대로 테스트하라. 우리는 2023년 9월까지 거슬러 올라가는 Chrome 웹 스토어의 일일 전체 스냅샷을 가지고 있다:
- 과거 날짜라고 가정하고 오늘날의 규칙을 실행하여 그날의 기회 목록을 생성한다.
- 해당 니즈에서 신규 사용자가 10,000명 이상에 도달했는지를 확인한다 (12개월 이내).
- 무작위로 선택된 니즈와 비교한다.
(백테스팅은 계량 투자(quant investing)에서 차용한 것이다: 오늘날의 규칙이 얼마나 설득력 있게 들리는지가 아니라, 과거 데이터에 적용했을 때 어떻게 작동했는지로 판단하는 것이다.)
이를 통해 어떤 신호가 우연을 능가하는지, 그 정도는 어느 정도인지, 차원별 가중치를 어떻게 설정해야 하는지, 그리고 내가 외부 연구에서 찾지 못한 것—스토어 데이터에서 발굴된 공백이 실제로 승리하는 누군가에 의해 채워지는지 여부—까지 알 수 있다.
먼저 수정해야 할 문제점들: 경쟁사 수를 계산하기 전에 중복 클론을 제거하고; 삭제 기록은 먼저 정리해야 한다. 많은 것이 스팸이기 때문에 실제 사용자가 있었고 규정을 준수한 경우만 유지하며; '히트(hits)'도 중복 제거해야 한다. 그렇지 않으면 한 승리자의 수십 개 클론이 수십 개의 히트로 계산된다.
현재 설계에 고려해야 할 한 가지 결과
무엇을 만들지 고민하고 있다면
- 시장을 개별 제품이 아닌 **필요(Needs)**로 바라보세요.
- **무엇(What)**을 결정하고, 그것의 **형태(Form)**는 분리하여 생각하세요.
- 먼저 "여기 어떤 격차(Gap)가 있는가?"라고 질문하세요. 신호 없이는 베팅도 없습니다.
- 구축의 용이성보다 제품의 우위성을 평가하세요. 그렇지 않으면 쉽지만 의미 없는 곳으로 표류할 것입니다.
- 구축하기 전에 **가장 위험한 가정, 가장 저렴한 테스트, 그리고 손절매 지점(stop-loss)**을 작성하세요.
- 항상 여러분의 성공률을 **무작위 기준선(random baseline)**과 비교하세요.
첫 번째 백테스트 결과는 상단 업데이트에서 확인할 수 있습니다. 포워드 체크가 완료되면, 쓸모없게 판명되는 신호까지 포함하여 그대로 게시하겠습니다.
현재 무엇을 만들지 어떻게 결정하시나요? 작업 중인 내용을 댓글로 알려주세요.
저는 Reid입니다. 지금은 구축하는 것이 싸졌지만, 무엇을 구축할지 아는 것은 그렇지 않습니다. 데이터 선정(Data picks), AI 구축(AI builds), 모든 결과가 공개되며—실패 사례도 포함됩니다.
출처: Wikipedia (Outcome-Driven Innovation); Strategyn; e-Literate, "Cracks in the Foundation of Disruptive Innovation"; Bill Gross 강연 스크립트 (Singju Post); Evanschitzky et al. 2012 메타 분석; Camuffo et al., Management Science; TechCrunch 2024-03-12 RevenueCat 데이터 관련; DebugBear, "Counting Chrome Extensions"; arXiv 2406.12710 및 2406.00374. 우리의 데이터: 100개 후보 연구 실행 및 30,009개 확장 프로그램 필요 클러스터링, 2026-09-24. 데이터: Chrome-Stats, 당사에서 처리함.
AI의 도움을 받아 작성되었습니다; 결정과 의견은 저의 것입니다.
만약 현재 방향을 저울질하고 있다면, 매일 무료 판결(verdict) 하나를 내립니다. 링크는 제 프로필에 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기