Klarna의 AI가 상담원 700명분의 업무를 수행했다: 수치가 측정한 것과 놓친 것
요약
Klarna의 AI 도입 사례를 통해 AI가 업무 처리량(throughput)을 획기적으로 높였음에도 불구하고, 기업이 잘못된 지표에 의존할 때 발생할 수 있는 전략적 오류를 분석합니다. AI가 700명분의 업무를 수행했다는 수치는 사실이나, 이것이 곧 대규모 해고를 의미하지는 않았음을 지적하며 데이터 해석의 중요성을 강조합니다.
핵심 포인트
- AI 도입으로 채팅 처리 시간이 11분에서 2분 미만으로 단축됨
- 업무 등가성(work-equivalency)과 실제 인원수(headcount)를 혼동해서는 안 됨
- 정확한 지표를 가지고도 잘못된 경영 목표를 설정할 위험이 있음
- AI 에이전트 운영 시 단순 처리량 외의 다각적 지표 검토 필요
2024년 2월 27일, Klarna는 AI가 일자리를 대체한다는 논의에서 가장 많이 인용되는 증거가 된 보도 자료를 발표했습니다. 수치는 구체적이었으며, 기업의 AI 발표 기준으로는 이례적으로 검증 가능한 수준이었습니다. 첫 달 동안, OpenAI 기반의 Klarna 어시스턴트는 전체 채팅의 3분의 2에 해당하는 230만 건의 고객 서비스 대화를 처리했습니다. 이전에는 11분이 걸렸던 업무를 2분 미만으로 해결했습니다. 반복 문의는 25% 감소했습니다. 회사는 2024년에 4,000만 달러의 이익 개선이 있을 것으로 추정했습니다. 그리고 모두가 기억하는 문장이 등장했습니다: "이는 풀타임 상담원 700명에 해당하는 업무를 수행하고 있습니다."
15개월 후, Klarna의 CEO는 Bloomberg를 찾아가 회사가 다시 인간 상담원을 채용하고 있다고 말했습니다.
이 이야기를 다시 전달할 때 거의 모든 경우에 적어도 한 가지 중요한 사실을 틀리게 말하며, 틀린 버전이 옳은 버전보다 더 편안하게 느껴집니다. 틀린 버전은 AI가 실패했거나, Klarna가 거짓말을 했다고 말합니다. 옳은 버전은 더 이상하고 더 유용합니다. 즉, 수치는 실제였고, AI는 수치가 말하는 대로 수행했으며, 그럼에도 불구하고 그 수치는 회사를 잘못된 목표로 안내했다는 것입니다. 만약 당신이 프로덕션 환경에서 소프트웨어 에이전트 (software agents)를 운영 중이거나, 이번 분기에 운영할지 여부를 결정하고 있다면, Klarna의 사례를 정확하게 파악할 가치가 있습니다. 왜냐하면 이 사례가 기록하고 있는 실수는 완전히 정확한 지표를 가지고도 저지를 수 있는 실수이기 때문입니다.
첫째, 거의 아무도 인쇄하지 않는 교정 사항
700이라는 숫자부터 시작해 봅시다. 이 이야기의 대중적인 버전은 잘못된 해석에 기반하고 있기 때문입니다.
Klarna는 AI를 위해 700명을 해고했다고 말한 적이 없습니다. 2024년 2월의 발표는 어시스턴트가 "풀타임 상담원 700명에 해당하는 업무를 수행하고 있다"고 말합니다. 이는 업무 등가성 (work-equivalency) 주장이며, 처리량 (throughput) 측정치이지, 인원수 (headcount) 조치가 아닙니다. Fast Company는 Klarna의 AI가 "700명을 해고한 후" 700명분의 업무를 수행한다는 헤드라인으로 이 이야기를 보도했고, 그 이후 수천 번 반복된 이 결합은 두 개의 별개 사실을 하나의 거짓된 사실로 용접해 버렸습니다.
두 가지 별개의 사실은 다음과 같습니다. Klarna는 장기간 채용 동결을 실시했으며, 그 기간 동안 인원수가 상당히 감소했습니다. Klarna의 CEO인 Sebastian Siemiatkowski는 이 감소의 주요 원인이 AI 기반의 효율성 때문이라고 공개적으로 언급했습니다. 그리고 Klarna의 고객 서비스는 전 과정에 걸쳐 직원이 아닌 주로 아웃소싱 (Outsourcing) 업체를 통해 운영되었습니다. Klarna는 최근인 2025년에도 여전히 수천 명의 아웃소싱 상담사와 협력하고 있다고 언급했습니다. 채용 동결은 자연 감소 (Attrition)와 AI에 관한 실제 이야기입니다. 700명이라는 숫자는 채팅 처리량 (Chat throughput)에 관한 실제 수치입니다. 이들은 서로 다른 증거를 가진 서로 다른 주장이며, 이들을 하나의 사건으로 취급하는 것을 멈출 때 비로소 유용한 분석이 가능해집니다.
이러한 교정은 단순히 까다로운 논쟁을 넘어 중요합니다. 왜냐하면 잘못 읽힌 버전은 두 번이나 잘못된 교훈을 주기 때문입니다. 만약 Klarna가 700명을 해고했다가 다시 해고하지 않은 것이라고 믿는다면, 이 이야기는 단순한 오만과 번복으로 읽히며, 그 해결책은 "AI를 위해 사람을 해고하지 마라"가 됩니다. 정확한 처리량 수치가 진정으로 성공적이었던 자동화 프로그램을 품질 실패로 몰아넣었던 실제 과정은, 아무도 일자리를 잃지 않는 상황에서도 적용될 수 있는 무언가를 가르쳐 줍니다.
번복이 실제로 어떠했는가
2025년 5월, Siemiatkowski는 Bloomberg에 Klarna가 다시 인간 고객 서비스로 피벗 (Pivoting)하고 있다고 말했습니다. 그는 유럽에서 가장 인용이 많이 되는 AI 낙관주의적 CEO 중 한 명으로서 2년을 보냈으며, 그의 이러한 번복은 그가 이를 완화하여 표현하지 않았기 때문에 부분적으로 헤드라인을 장식했습니다. 보도가 확산됨에 따라 Klarna가 발표하고 그달 Forbes가 인용한 성명서에서, 그는 진단을 한 문장으로 정리했습니다: "AI 자체가 아니라 비용에 대한 과도한 강조가 품질 저하를 초래했습니다."
이 문장을 주의 깊게 읽으십시오. 왜냐하면 이것은 회사의 자체적인 사후 분석 (Post-mortem)을 11개의 단어로 압축한 것이기 때문입니다. "AI가 환각 (Hallucination)을 일으켰다"가 아닙니다. "기술이 준비되지 않았다"도 아닙니다. 비용에 대한 과도한 강조입니다. 시스템은 최적화하라고 지시받은 것을 최적화했고, 주어진 목표를 달성했으며, 그 목표가 문제였습니다.
반전의 메커니즘은 수사(rhetoric)만큼이나 시사하는 바가 큽니다. Klarna는 콜센터를 재건한 것이 아닙니다. 회사의 설명에 따르면, Uber와 유사한 모델로 채용된 유연한 원격 환경의 단 두 명의 새로운 상담원(agent)으로 파일럿(pilot)을 시작했으며, 일상적인 물량(routine volume) 처리를 위해 AI 어시스턴트(AI assistant)를 그대로 유지하면서 규모를 확장할 계획을 세웠습니다. 그리고 'AI 실패'라는 해석을 종식시켜야 할 세부 사항이 여기에 있습니다. Klarna는 인간 상담원의 재채용을 발표하는 동시에, 어시스턴트가 현재 800명 이상의 풀타임(full-time) 역할에 해당하는 업무를 수행하고 있다고 밝혔습니다. 인간이 돌아오는 동안에도 그 환산 수치는 오히려 올라갔습니다.
두 가지 움직임 모두 합리적이었습니다. 왜냐하면 서로 다른 분포(distribution)를 다루고 있기 때문입니다. 이는 우리를 실제 교훈으로 이끕니다.
물량(Volume)은 리스크 노출 가치(value-at-risk)가 아니다
고객 서비스 업무는 헤드라인 지표들이 뭉뚱그려 버리는 방식으로 이봉형(bimodal) 구조를 띱니다. 물량의 큰 부분은 일상적(routine)입니다. 내 환불은 어디에 있는지, 카드를 업데이트해달라, 왜 두 번 청구되었는지와 같은 것들입니다. 물량의 작은 부분은 그 외의 모든 것입니다. 실제로 사기인 분쟁 청구, 이탈(churn) 직전의 고객, 규제 기관과 연관된 예외 사례(edge case), 스크린샷으로 남게 될 불만 사항 등이 이에 해당합니다. 일상적인 다수(routine majority)는 처리 비용이 저렴하며, 잘못 처리했을 때의 비용도 저렴합니다. 반면, 브랜드 손상, 고객 이탈, 그리고 소송이 발생하는 곳은 바로 이 작은 꼬리(tail) 부분입니다.
2024년 2월 Klarna의 슬라이드에 담긴 모든 수치는 일상적인 다수를 측정했습니다. 채팅의 3분의 2: 물량(volume). 2분 대 11분: 해결 가능한 잡무(errands)에서의 속도. 재문의 25% 감소: 디플렉션(deflection, 문의 차단). 4,000만 달러: 고물량 계층(high-volume tier)에서 회피한 비용. 이것들은 쉬운 분포(easy distribution)에 대한 정직한 측정치입니다. 슬라이드의 수치 중 단 하나도 꼬리(tail) 부분을 측정하지 않았습니다. 왜냐하면 꼬리는 정의상 물량이 적고, 그 비용은 나중에 다른 항목으로 귀속되어 나타나기 때문입니다. 즉, 두 분기 뒤 리텐션 코호트(retention cohorts)에 나타나는 이탈, 소셜 미디어 사건으로 표면화되는 에스컬레이션(escalations), 그리고 어떤 계정에도 기록되지 않는 신뢰 침식 등이 바로 그것입니다.
따라서 자동화 프로그램은 미묘한 일을 저질렀습니다. 측정된 분포(measured distribution)에서 성공함으로써, 측정되지 않은 분포(unmeasured distribution)로부터 인간의 역량을 끌어내 버린 것입니다. 과거에 까다로운 사례들을 흡수하던 사람들은 쉬운 사례들을 처리하던 사람들과 동일했습니다. 쉬운 사례들이 기계로 넘어가자, 인력 배치 모델(staffing model)은 그 물량을 따라갔습니다. 개별적인 일상적 채팅(routine chat)은 괜찮았습니다. 대부분의 복잡한 채팅도 아마 괜찮았을 것입니다. 하지만 꼬리 부분(tail)의 총체적인 품질은 하락했고, 실제로 품질의 가치가 결정되는 곳은 바로 그 꼬리 부분입니다.
이 부분은 에이전트(agents)를 배포하는 누구에게나 명확하게 일반화될 수 있는 Klarna 이야기의 핵심입니다. 왜냐하면 이것은 챗봇(chatbots)과는 아무런 상관이 없기 때문입니다. 시스템을 승리처럼 보이게 만든 지표와 시스템을 실패하게 만든 메커니즘은 동일한 것이었습니다. 즉, 정확하게 측정된 '쉬운 분포'에서의 처리량(throughput)이었고, '어려운 분포'는 침묵 속에 남겨두었습니다. 만약 나머지 5%에 가치가 집중되어 있다면, 시스템은 상호작용의 95%에서 진정으로 성공하고 있더라도 여전히 가치를 파괴하고 있을 수 있습니다. 성공 지표(success metrics) 중 그 무엇도 당신에게 이 사실을 알려주지 않을 것입니다. 지표들은 CEO가 Bloomberg에 상황 역전을 설명해야 하는 순간까지 매 분기 더 좋아지기만 할 것입니다.
멀티 에이전트 소프트웨어 시스템(multi-agent software systems)을 운영하는 운영자들은 다른 각도에서도 이 형태를 알아볼 것입니다. 각 하위 작업(subtask)은 완료되고, 각각은 고립된 상태에서 정당해 보이지만, 실패는 아무도 계측(instrumented)하지 않은 집계(aggregation) 수준에서만 존재합니다. Klarna는 가장 인간적인 업무 부하를 가진 상태에서, 양 끝에 실제 비용이 걸려 있는 월 230만 건의 대화 규모로 이러한 패턴을 실행했습니다.
한 기업의 실수인가, 아니면 계층적 현상인가?
아무리 잘 기록되어 있더라도, 단 한 번의 역전은 특이한 사례(idiosyncratic)일 수 있습니다. 하지만 증거는 그렇지 않다고 말합니다.
Gartner는 업계 언론을 통해 2025년까지 널리 보도된 예측에서, AI를 이유로 고객 서비스 인력을 감축한 조직의 약 절반이 2027년까지 해당 기능을 다시 인력으로 채울 것이라고 전망했습니다. 이 수치를 측정값이 아닌 분석가의 예측으로서 있는 그대로 받아들이되, 그 내용에 주목하십시오. 즉, 거의 누구도 예측하지 않는 '지원 부문의 AI 도입 후퇴'를 말하는 것이 아니라, 인력 기반의 역량(staffed capacity)을 자동화된 역량(automated capacity)으로 일대일 교체하려는 특정 움직임이 약 절반의 경우에 부분적으로 되돌려진다는 점을 주장하고 있습니다. 이러한 '되돌림(unwind)'이 핵심입니다. 이는 조직들이 사후에, 업무량 지표(volume metrics)가 결코 나타내지 못했던 어떤 범주의 업무를 계속해서 발견하고 있음을 시사합니다.
유사한 사례들도 쌓여가고 있습니다. 호주 커먼웰스 은행(Commonwealth Bank of Australia)은 2025년에 음성 AI 시스템을 도입하기 위해 수십 개의 콜센터 직무를 감축했으나, 통화량과 서비스 품질이 부정적인 방향으로 움직인 후 몇 주 만에 해당 결정을 번복한 것으로 보고되었습니다. 세부 사항은 다르지만 패턴은 일치합니다. 즉, 업무량 예측(volume forecast)을 근거로 제거되었던 업무에 예측이 보지 못한 부하(load)가 포함되어 있었음이 드러난 것입니다.
또한 이 패턴에는 주의 깊게 살펴볼 만한 '명칭의 문제'가 있습니다. AI 기반 감축을 후회하는 경영진의 비율이라 주장되는 수치나, 절감된 비용 대비 새로운 비용의 깔끔한 비율 등 이 분야에서 유통되는 일부 통계들은 방법론을 찾을 수 없는 벤더 블로그(vendor blogs)나 콘텐츠 팜(content farms)에서 유래되었습니다. Klarna의 사례가 가치 있는 이유는 바로 그러한 것들이 필요하지 않기 때문입니다. 주요 문서인 회사의 2024년 2월 발표와 2025년 5월 성명서에는 전체 과정이 담겨 있습니다. 즉, 정확한 승리, 정확한 진단, 재고용, 그리고 이전보다 더 높은 등가성(equivalency)으로 여전히 작동 중인 어시스턴트까지 말입니다. 이야기가 1차 자료(primary sources)를 통해 자신의 논점을 증명할 때, 출처 불분명한 통계에서 가짜 정밀함(fake precision)을 빌려오는 것은 오히려 논점을 약화시킬 뿐입니다.
이를 통해 실제로 해야 할 일
유혹에 빠져 Klarna를 "AI는 고객 서비스를 할 수 없다"라는 분류에 집어넣고 싶겠지만, 그 분류는 틀렸습니다. 해당 어시스턴트(assistant)는 수백만 건의 대화를 수용 가능한 수준으로 처리했고, 실제 비용을 절감했으며, 여전히 그렇게 하고 있습니다. Klarna 자체의 환산 추정치(equivalency estimate)는 상황이 반전되는 동안에도 상승했습니다. 또 다른 유혹은 이를 "지표는 거짓말을 한다"라는 분류에 넣는 것인데, 이는 더 게으른 방식이며 이 또한 틀렸습니다. 지표는 사실이었습니다. 다만 불완전한 질문에 대한 완전한 측정치였을 뿐입니다.
전이 가능한 실무 지침은 더 좁고 어렵습니다. 자동화의 성과를 확장하기 전에, 당신의 성공 지표(success metric)가 침묵하고 있는 분포(distribution)를 찾아내고, 그 침묵이 값비싼 대가로 돌아오기 전에 수치화하십시오. 고객 지원 업무의 경우, 이는 꼬리 부분(tail)을 명시적으로 측정하는 것을 의미합니다. 즉, 에스컬레이션(escalation) 시의 해결 품질, 까다로운 사례가 봇(bot)에 부딪힌 고객들의 이탈률(churn), 그리고 복잡한 문제가 일상적인 답변을 얻을 수 있을 만큼 충분히 오랫동안 일상적인 문제로 위장하는 비율 등을 측정하는 것입니다. 만약 계획이 인간의 역량을 줄이는 방향이라면, 질문은 자동화가 물량을 처리할 수 있느냐가 아니라, 자동화가 전혀 측정되지 않았던 사례들을 이제 누가 흡수하느냐가 되어야 합니다. "고립된 상태에서는 괜찮음"은 집계(aggregation) 과정에서 살아남을 수 있는 속성이 아니며, Klarna의 사례는 양 끝에 보도 자료가 붙은 채로 그 실패가 어떤 모습인지를 보여줍니다.
Siemiatkowski는 다행히도 스스로 조용한 부분(the quiet part)을 언급했습니다. 품질 저하를 초래한 것은 AI가 아니라 비용에 대한 과도한 강조였다는 점입니다. 이 실수를 범하는 대부분의 조직은 Bloomberg 인터뷰나 채용 파일럿(hiring pilot) 기회를 얻지 못할 것입니다. 그들은 그저 가장 중요했던 업무를 조용히 망가뜨릴 뿐이며, 그동안 그들의 대시보드(dashboard)는 700명, 800명, 그 이상의 인력에 해당하는 업무를 수행하고 있다고 보고할 것입니다. 이 모든 보고는 사실이지만, 정작 고장 난 부분에 대해서는 아무것도 말해주지 않습니다.
당신의 슬라이드에 적어야 할 숫자는 Klarna의 슬라이드가 빠뜨린 숫자입니다. 즉, 아무도 그 아래를 지탱하고 있지 않을 때 꼬리 부분(the tail)이 치르게 하는 비용입니다.
Sources
출처
-
Klarna, "Klarna AI assistant handles two-thirds of customer service chats in its first month," 보도 자료, 2024년 2월 27일 (230만 건의 대화, 3분의 2의 점유율, 11분에서 2분으로 단축된 해결 시간, 재문의 25% 감소, 4,000만 달러 추정치, 그리고 "전업 상담원 700명분의 업무에 상응"이라는 문구).
-
Bloomberg, "Klarna Turns From AI to Real Person Customer Service," 2025년 5월 8일 (입장 번복 인터뷰).
-
Forbes, "Klarna Reverses AI Push, Says Customers Prefer Human Support," 2025년 5월 18일 (Klarna 성명서에서 Siemiatkowski가 비용을 과도하게 강조한 인용구; 2인 상담원 파일럿 프로그램; 800개 이상의 역할에 상응한다는 수치; 수천 명의 아웃소싱 상담원 수치).
-
Entrepreneur, "Klarna Is Hiring Customer Service Agents After AI Couldn't Cut It on Calls," 2025년 (재채용 파일럿 프로그램에 대한 확인).
-
Fast Company, 2024년 ("700명 해고"로 잘못 읽힌 사례로 인용되었으며, 사실 근거로 사용된 것은 아님).
-
Gartner, 업계 언론에서 다뤄진 2027년까지 AI 기반 고객 서비스 감축에 따른 인력 재배치 전망 (전체적으로 전망치로 분류됨).
이러한 실패는 아무도 측정(instrument)하지 않은 집계 수준에서만 존재했습니다. 이는 바로 상담원 개별 기록(per-agent record)이 가시화하기 위해 만들어진 바로 그 계층입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기