Zillow은 인간의 가격 수정 권한을 비활성화했고, 그 결과 4억 790만 달러의 손실을 기록했다
요약
Zillow이 AI 모델의 가격 결정 과정에서 인간의 수정 권한을 비활성화했다가 4억 790만 달러의 막대한 손실을 입은 사례를 분석합니다. 실패의 원인은 모델 자체의 결함이 아니라, 모델의 오차를 보완할 수 있는 인간의 개입(override)을 차단한 운영상의 결정에 있었습니다.
핵심 포인트
- Zillow은 AI 모델 Zestimate의 결과값을 인간 전문가가 수정하지 못하도록 제한함
- 모델의 오차를 제어할 '인간 오버라이드' 기능 부재가 막대한 재고 자산 감액으로 이어짐
- AI 모델은 통계적 꼬리 부분(outliers)에서 틀릴 수 있음을 인정해야 함
- 자동화된 의사결정 시스템 구축 시 인간의 개입 채널 확보가 필수적임
모두가 말하는 이야기는 "AI가 집값을 잘못 책정했다"는 것이었습니다. 하지만 그것은 피상적인 해석입니다. 모델이 실패한 것이 아닙니다. 비활성화된 수정 권한(override)이 실패의 원인이었으며, 이는 현재 모든 에이전트 팀의 화이트보드에 적혀 있는 바로 그 결정입니다.
2021년 초, Zillow은 사후에 돌이켜보면 가격 전략이라기보다 자체 면역 체계를 통제된 해체(controlled demolition)를 하는 것처럼 보이는 결정을 내렸습니다. 이 회사는 판매자로부터 직접 집을 사서 잠시 보유한 뒤 다시 파는 주택 매매(home-flipping) 사업인 Zillow Offers를 운영하고 있었습니다. 제안(offers)의 핵심 엔진은 Zillow의 유명한 알고리즘 기반 주택 가치 추정치인 Zestimate였으며, 회사는 모델이 내놓은 결과값을 검증(sanity-check)하는 역할을 하는 인간 가격 전문가 팀을 보유하고 있었습니다. 내부적으로 "Project Ketchup"이라고 보고된 이 이니셔티브 하에서, Zillow은 두 가지 일을 동시에 수행했습니다. 자격 요건을 갖춘 주택에 대해 Zestimate를 현금 제안가로 직접 사용하기 시작했습니다. 그리고 비즈니스 언론의 해당 프로그램 보도에 따르면, 회사는 가격 전문가들이 알고리즘의 가치 평가를 수정하는 것을 막았으며, 그들에게 알고리즘에 의문을 제기하는 것을 중단하라고 요구했습니다.
전문가들은 떠나지 않았습니다. 그들의 책상도 옮겨지지 않았습니다. 회사는 단지 모델이 생성한 숫자가 곧 확정된 숫자이며, 그들의 역할은 더 이상 모델과 논쟁하는 것이 아니라고 말했을 뿐입니다. 제동 장치가 해제되자 인수 규모(Acquisition volumes)는 예상대로 움직였습니다. 보고에 따르면 단 한 분기 만에 두 배 이상 증가했습니다. Zillow은 인간이 하향 조정을 할 수 없는 가격으로, 그 어느 때보다 빠르게 집을 사들이고 있었습니다.
2021년 11월, 상황은 종료되었습니다. Zillow은 Zillow Offers 사업을 완전히 정리하고 인력의 약 4분의 1인 약 2,000명을 감원한다고 발표했습니다. 2021년 12월 31일로 종료된 회계연도에 대한 10-K 보고서에는, 보고서 자체의 표현을 빌리자면 "회사의 현재 미래 판매 가격 추정치보다 높은 가격으로 의도치 않게 주택을 매입한 결과, 총 4억 790만 달러의 재고 자산 감액(write-down)이 발생했다"라고 기록되었습니다. 단 하나의 인간 수정 채널이 의도적으로 꺼져 있었고, 그 채널을 끄기에 최악의 시점에, 가치보다 더 비싸게 산 집들의 가격이 4억 790만 달러에 달했습니다.
그 이후 모두가 이야기한 스토리는 "AI가 집값을 잘못 책정했다"는 것이었습니다. 그 이야기가 완전히 틀린 것은 아니지만, 그것은 피상적인 해석이며, 피상적인 해석은 2026년에 자동화된 의사결정(automated decisions)을 배포하려는 모든 이들에게 실제로 전달되어야 할 교훈을 묻어버립니다. 왜냐하면 실패의 원인은 모델이 아니었기 때문입니다. 비활성화된 오버라이드(override, 수동 제어) 기능이 문제였습니다.
모델은 꼬리 부분(tails)에서 틀립니다. 그것은 놀라운 일이 아닙니다.
"AI가 실패했다"라는 프레임이 놓치고 있는 점은 이것입니다. 가격 책정 모델이 때때로 틀리는 것은 결함이 아닙니다. 그것은 가격 책정 모델의 기본 조건이며, 모델을 사용하는 모든 진지한 운영 체계는 이를 가격에 반영합니다. Zestimate에는 알려진 오차 분포(error distribution)가 있었습니다. 대다수의 주택에 대해서는 충분히 근접한 값을 제시했지만, 일부 주택, 즉 특이한 주택, 급변하는 시장, 학습 데이터에서 과소 대표된 독특한 특성을 가진 부동산의 경우에는 오차가 있었으며, 때로는 심하게 틀리기도 했습니다. 이는 비밀이 아니었습니다. 애초에 인간 전문가 팀이 존재했던 이유 자체가 바로 이것 때문이었습니다. 그들의 가치는 모델이 맞았던 95%의 사례, 즉 그들이 순수하게 비용(overhead)에 불과했던 사례에 있었던 것이 아닙니다. 그들의 가치는 모델이 틀렸던 5%의 사례, 특히 Zillow이 돈을 송금하기 전에 잘못된 사례를 잡아내는 데 전적으로 있었습니다.
Project Ketchup가 한 일은 95%를 신뢰함으로써 얻는 속도를 위해, 그 5%를 잡아내던 메커니즘을 삭제한 것이었습니다. 그리고 그 거래는 분포(distribution)가 변하기 직전까지는 매우 영리해 보입니다. 분포가 변하는 시점에 이르면, 5%는 더 이상 흩어져 있는 용인 가능한 오류율이 아니라 상관관계가 있는 시스템적 오류가 됩니다. 2021년, 미국 주택 시장은 예측가들 중 극소수만이 예측했던 움직임을 보였으며, 자동 가치 평가(automated valuation)에 내재된 최근 역사의 가정들을 깨뜨리는 방식으로 움직였습니다. 모델이 갑자기 멍청해진 것이 아닙니다. 모델 아래의 지면이 움직였고, 오류들이 서로 상쇄되는 것을 멈추고 한 방향으로 쌓이기 시작했습니다. 그리고 "이 오퍼들은 몇 주 동안 과열되어 있다, 무언가 잘못되었다"라고 알아차릴 수 있었던 유일한 시스템은, 알아차리는 것을 중단하라는 명령을 받았습니다. 전문가들은 여전히 건물 안에 있었습니다. 하지만 그들은 수정 채널(correction channel)에서 관찰자로 전락해 있었습니다.
이 점을 염두에 두고 CEO 자신의 설명을 읽어보십시오. 왜냐하면 그 설명은 언론 보도보다 더 정밀하기 때문입니다. Rich Barton는 회사가 "주택 가격 예측의 예측 불가능성이 우리가 예상했던 것을 훨씬 초과한다는 것을 확인했으며, Zillow Offers를 계속 확장하는 것은 너무 큰 수익 및 대차대조표 변동성(volatility)을 초래할 것이라고 판단했다"라고 말했습니다. 그 문장이 실제로 무엇을 고백하고 있는지 주목하십시오. 그것은 정확도(accuracy)에 대한 고백도, 모델의 중앙 추정치(central estimate)가 편향되었다는 것에 대한 고백도 아닙니다. 그것은 분산(variance)에 대한 고백입니다. 문제는 Zestimate가 일관되게 틀렸다는 것이 아니라, 그 오류의 확산(spread)이 사업체가 감당할 수 없는 수준이었다는 것이며, Zillow은 그해 동안 자신들이 가진 모든 완충 장치(shock absorber)를 제거하는 데 시간을 보냈습니다. Barton는 꼬리 부분(tail)을 잘라내던 장치를 해체하면서, 팻 테일(fat tail)에 대한 노출을 확장한 회사를 묘사하고 있습니다. 그의 성명에서 핵심적인 역할을 하는 단어는 "변동성(volatility)"이며, 변동성이야말로 인간의 검토(human review)가 존재하는 바로 그 이유입니다.
사후 분석(postmortem)은 그 자체의 수치부터 정확해야 한다
예측 실패에 대해 글을 쓰다 보면, 그 부주의함의 대상이 되는 바로 그 수치들에 대해서조차 부주의해지고 싶은 유혹에 빠지기 쉽습니다. 그리고 이 이야기는 그러한 유혹의 지뢰밭과도 같습니다. 왜냐하면 최소한 네 가지의 서로 다른 달러 수치가 "Zillow의 수치"로 유통되고 있으며, 이들은 각각 네 가지 서로 다른 것을 지칭하기 때문입니다. 위에서 언급한 4억 790만 달러는 10-K 보고서에 기재된 연간 재고 자산 감액(inventory write-down) 규모입니다. 널리 인용되는 별도의 4억 2,100만 달러는 iBuying 부문의 2021년 3분기 손실액으로, 다른 것을 측정하는 또 다른 수치입니다. 3분기에만 보고된 감액 규모는 3억 400만 달러였으며, 4분기에는 2억 4,000만 달러에서 2억 6,500만 달러 사이의 추가 손실이 예상된다는 전망치(forward-looking estimate)가 있었습니다. "총액"으로 자주 인용되는 더 큰 반올림된 숫자가 2차 보도 매체들 사이에서 떠돌고 있지만, 이는 명확한 세부 항목(line-item) 근거가 없습니다. 신중한 필자라면 이를 단순히 인용하지 않을 것입니다. 출처가 불분명한 수치를 물려받은 사후 분석(postmortem)은, 자신이 진단하고 있는 바로 그 오류를 축소판 형태로 범하고 있는 것이기 때문입니다.
그리고 숫자를 정확히 파악했을 때만 보이는, 잠시 멈춰서 생각해 볼 만한 작고 날카로운 아이러니가 있습니다. 3분기 감액분과 4분기 전망치를 더해 보면, 즉 3억 400만 달러에 예상치인 2억 4,000만~2억 6,500만 달러를 더하면, 예상되는 재고 손실액은 약 5억 4,400만 달러에서 5억 6,900만 달러 범위가 됩니다. 그러나 실제 연간 총 감액 규모는 4억 790만 달러였습니다. 회사가 자체적으로 예측한 손실액이 실제 현실보다 1억 달러 이상 초과했던 것입니다. 예측의 예측 불가능성 때문에 무너진 기업이, 정작 자신의 실패 규모조차 낙관적인 방향으로 정확히 예측하지 못했습니다. 이것은 누군가를 곤경에 빠뜨리려는 의도가 아니라, 다른 옷을 입고 나타난 동일한 교훈입니다. 예측은 어렵고, 꼬리 위험(tails)은 넓으며, 확신을 가지고 말한 숫자가 반드시 실현된 숫자인 것은 아닙니다. 그 숫자가 주택 가격이든 예상 손실액이든 말입니다. 만약 당신이 자신의 예측을 너무 과하게 신뢰했던 기업에 대해 글을 쓰려 한다면, 당신이 할 수 있는 최소한의 도리는 당신 자신의 예측 또한 느슨하게 유지하는 것입니다.
피상적인 버전이 생략하는 정직함이 하나 더 있습니다. 이것은 알고리즘 기반의 주택 가격 책정 (algorithmic home pricing)이 실패할 운명이라는 증거도 아니며, Zillow의 엔지니어들이 바보였다는 증거도 아닙니다. iBuying 모델은 Zillow의 철수 이후에도 살아남았고, 경쟁사들은 계속 운영을 이어갔습니다. 여기서 중요한 차이는 두 종류의 '틀림' 사이에 있습니다. 예측은 사후적으로 (ex post), 즉 시장이 예상치 못한 방향으로 움직인 후에 틀린 것이었습니다. 예측 불가능한 시장을 예측하지 못했다고 누군가를 비난하는 것은 값싼 사후 확신 편향 (hindsight)에 불과합니다. 하지만 속도를 높이기 위해 수동 수정 권한 (override)을 비활성화하기로 한 거버넌스 결정은 사전적으로 (ex ante), 즉 결정이 내려진 그 순간에 이미 틀린 것이었습니다. 시장이 어떻게 변했는지와 상관없이, 그 결정은 틀렸을 때 대응할 수 있는 능력을 맞바꿨기 때문입니다. 미래를 보지 못한 것에 대해 Zillow를 탓할 수는 없습니다. 하지만 미래가 닥쳤을 때 반응할 수 있는 자체적인 역량을 의도적으로 제거한 것에 대해서는 책임을 물을 수 있습니다. 이는 나쁜 결과가 나오기 전까지는 올바른 결정처럼 보였을 뿐인 결정입니다.
현재 모든 에이전트 팀이 내리고 있는 결정
이것이 2021년의 이야기가 아니라 2026년의 이야기인 이유가 여기에 있습니다. 주택과 Zestimate를 걷어내고 보면, Zillow의 결정은 올해 AI 에이전트 (AI agents)를 출시하는 모든 기업의 화이트보드 위에 적혀 있는 결정과 정확히 일치합니다. 당신에게는 모델이 있습니다. 모델은 대부분의 경우 맞습니다. 당신에게는 인간 참여형 (human-in-the-loop) 검토, 즉 모델이 제안한 내용을 거부하거나 수정할 수 있는 승인 단계와 전문가가 있습니다. 그런데 그 검토 과정은 느리고, 비용이 많이 들며, 눈에 띄게 확장성 (scale)이 떨어집니다. 그리고 회의실의 누군가는 인간이 압도적인 다수의 경우 모델의 의견에 동의한다는 차트를 만들어낼 수 있습니다. 그렇다면, 정확히 우리는 그들에게 무엇을 위해 비용을 지불하고 있는 걸까요? 수동 수정 권한을 제거하라는 압박은 언제나 한 방향으로만 흐릅니다. 왜냐하면 수정 권한을 유지하는 비용은 눈에 보이는 항목이지만, 그것을 제거함으로써 발생하는 비용은 닥치기 전까지는 볼 수 없는 꼬리 위험 (tail risk)이기 때문입니다.
Zillow은 그 논거가 가격으로 증명된 사례이며, 그 대가는 4억 7,900만 달러와 비즈니스 자체였습니다. 해당 검토가 순수 비용처럼 보였던 이유는 그것이 실제로는 비용이 아니었던 이유와 동일합니다. 모델이 95%의 시간 동안 정확하다면, 인간의 확인은 95%의 시간 동안 아무런 기여도 하지 않는 것처럼 보이며, 그 연간 유지 비용 전체는 사전에 식별할 수 없는 몇 가지 사례에서만 발생하기 때문입니다. 당신은 평균적인 사례에 대해 비용을 지불하는 것이 아닙니다. 당신은 상관관계가 있는 나쁜 분기 (correlated bad quarter), 분포 변화 (distribution shift), 그리고 모델의 오류들이 일렬로 늘어서서 같은 방향을 가리키기 시작하는 그 순간을 위해 비용을 지불하는 것입니다. 수정 권한 (override)을 제거하는 것은 보험을 삭제하는 것과 같습니다. 보험 청구를 한 적이 없다는 이유로, 바로 청구가 발생하려는 사이클의 시점에 보험을 없애버리는 것과 같습니다.
그리고 수정 권한이 실제로 어떻게 작동했을지를 주목하십시오. 이것이 바로 수정 권한은 저렴하게 만들고 손실은 비싸게 만드는 부분이기 때문입니다. Zillow의 규모에서는 개별적으로 잘못 책정된 집을 모두 잡아낼 필요가 없었습니다. 그것은 진정으로 불가능한 일이며, 자동화를 적용하는 것이 타당한 사례입니다. 인간 채널이 포착하는 것은 집합적 신호 (aggregate signal)입니다. 이는 단일 거래에서는 드러나지 않지만, 흐름을 지켜보는 사람이라면 볼 수 있는 것입니다. 예를 들어, 몇 주 동안 최종 판매 가격보다 제안가가 지속적으로 높게 형성되거나, 마진이 조용히 역전되는 동안 매입량이 급증하거나, 너무 높은 가격에 매입된 주택들로 장부 (book)가 채워지고 있다는 냄새 같은 것 말입니다. 그것은 대시보드를 가진 분석가 한 명이 수행하는 느리고 지루한 업무이며, 바로 Project Ketchup이 전문가들에게 알고리즘의 수치가 최종적이라고 말하며 없애버린 바로 그 업무입니다. 상관관계가 있는 오류는 자산 상각 (write-down)이 발생하기 훨씬 전부터 집합적인 형태로 스스로를 알립니다. Zillow은 그 신호를 들을 수 있는 유일한 역할을 제거해 버렸습니다.
따라서 Zillow이 실행해야 했던 실질적인 규칙은 "절대 자동화하지 마라" 혹은 "항상 인간을 루프 안에 두어라(human in the loop)"와 같은 것이 아니었습니다. 이 두 가지는 너무 막연하여 유용하지 않습니다. 그보다 더 좁고 실행 가능한 규칙이 필요합니다. 수정 채널을 비활성화하기 전에, 모델이 무작위가 아니라 체계적으로(systematically), 즉 한꺼번에 모두 같은 방향으로 틀렸을 때 당신의 노출(exposure)에 어떤 일이 벌어질지 자문해 보십시오. 왜냐하면 그것이 바로 수동 제어(override) 기능이 존재해야 하는 실패의 형태이며, 상황이 좋을 때 계산되는 모든 지표에서는 보이지 않기 때문입니다. 그리고 "모델이 보통은 맞으므로, 검토는 오버헤드(overhead)일 뿐이다"라는 주장을 비즈니스 사례가 아닌 위험 신호(red flag)로 취급하십시오. 왜냐하면 그 문장은 오버헤드를 설명하는 것이 아니기 때문입니다. 그것은 보험(insurance)을 설명하고 있으며, "보통"이라는 단어가 모든 역할을 수행하고 있습니다. 즉, 그 단어는 당신이 삭제하려는 것을 유지했기를 바라게 될 빈도를 정확하게 측정하는 척도입니다. Zillow에는 전문가들이 있었습니다. 모델도 있었고, 자금도 있었습니다. 더 빠르게 나아가기 위해 그들이 제거한 것은, 일상적인 모델 오류와 9자릿수(억 단위)의 자산 상각(write-down) 사이를 막아주던 유일하고 저렴한 메커니즘이었으며, 그들은 바로 그 메커니즘이 필요했던 폭풍이 몰아치기 직전의 평온한 시기에 그것을 제거해 버렸습니다.
이 블로그의 동반 기사에서는 외부로부터 파괴된 기업, 즉 타인의 제품에 의해 비즈니스 모델이 무너진 기업을 살펴본 적이 있습니다. Zillow은 그 거울 이미지와 같습니다. 내부로부터 파괴된 기업, 즉 스스로의 모델에 의해 파괴된 기업이며, 이를 막을 수 있었던 인간들은 바로 그 자리에 서서 그저 지켜보라는 명령을 받았습니다. 외부로부터의 파괴는 항상 막을 수 있는 것이 아닙니다. 하지만 내부로부터의 파괴는 스스로에게 행하는 것이며, 그것을 행하는 당일에는 언제나 진보(progress)처럼 보입니다.
Sources
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기