
“알리사, 켜줘”는 간단한 명령일까? Alexa+는 기본적인 명령에서도 비틀거린다
요약
Amazon의 생성형 AI 어시스턴트 Alexa+가 음악 재생 및 영상 서비스 등 기본적인 명령 수행에서 심각한 오류를 보이고 있습니다. Amazon은 복합 명령 수행을 위한 Moonraker 프로젝트에 막대한 GPU 비용을 투자하고 있으나, 실제 사용자 경험은 기대에 미치지 못하는 상황입니다.
핵심 포인트
- Alexa+는 음악 및 비디오 재생 등 기초적인 명령에서 높은 오류율을 보임
- Amazon은 복합 동작 수행을 위한 Moonraker 프로젝트에 연간 1억 달러 이상의 GPU 비용 투입 예정
- Anthropic Sonnet 등 고성능 모델을 활용함에도 불구하고 실제 인터페이스 조율 능력은 미흡함
“알리사, 음악 틀어줘”. “알리사, 민스크 날씨 어때”. 당신은 생각 없이 이 말을 내뱉고 작동하기를 기다립니다. 아주 간단한 명령이니까요. 미국에서는 WIRED의 기자가 생성형 AI (Generative AI) 어시스턴트로 재구성된 Amazon의 Alexa+를 대상으로 한 달 동안 동일한 장면을 재현해 보았습니다. 그는 Charli XCX를 요청했지만, Echo Show 15에서는 Sombr의 “Back to Friends” 트랙이 흘러나왔습니다. The Black Keys를 요청하자 Alabama Shakes가 연주되었습니다. 그리고 어시스턴트가 HBO Max에서 드라마 The Pitt를 틀어야 했을 때, 그는 드라마가 “이미 재생 중”이라고 몇 번이나 확신하며 보고했지만, 정작 화면에는 “Who's Watching” 프로필 선택 메뉴가 떠 있었습니다. 테스트 작성자의 결론은 짧았습니다: Alexa+는 “그냥 제대로 작동하지 않는다”.
그리고 2026년 7월, Business Insider는 Amazon의 내부 계획 문서를 공개했습니다: 회사 내부에는 이전에 공개되지 않았던 Moonraker 프로젝트가 존재하며, 이는 Alexa가 “차를 예약하고 친구에게 메시지를 보내줘”와 같이 하나의 요청으로 두 가지 동작을 연속해서 수행하도록 학습시키는 것을 목표로 합니다. GPU 예상 비용은 2026년 한 해에만 1억 달러를 상회합니다. 사용자가 아주 기초적이라고 생각하는 일을 스피커가 해내기 위해 1억 달러를 쓰는 셈입니다.
Amazon이 테스트에 사용하는 모델들(문서에는 Anthropic Sonnet이 등장함)은 음성 인터페이스 없이도 러시아에서 직접 이용 가능합니다: provod.ai (러시아의 OpenRouter)에서는 동일한 Claude와 GPT를 VPN이나 해외 카드 없이 공식 요율의 루블화로 이용할 수 있습니다. 실무적인 부분은 마지막에 다시 다루기로 하고, 먼저 오류의 해부학부터 살펴보겠습니다.
“간단한 명령”에서 정확히 무엇이 고장 나는가?
요약하자면: WIRED(2026년 3월)와 Consumer Reports(2025년 12월)의 독립적인 테스트에 따르면, Alexa+는 음악, 비디오, 택시, 메모, 일기 예보와 같은 일상적인 시나리오의 핵심 부분에서 오류를 일으킵니다. 이는 예외적인 사례가 아니라, 사람들이 스피커를 구매하는 바로 그 이유인 명령들입니다.
WIRED의 음악 테스트는 마치 복권 당첨을 기다리는 것과 같습니다. "Lucy Dacus의 노래를 틀어줘"라는 요청은 트랙을 재생하는 대신, 어시스턴트가 단순히 해당 문구로 YouTube 텍스트 검색을 수행하는 결과로 이어졌습니다. 다시 명령을 내렸으나 결국 오류가 발생하며 홈 화면으로 돌아갔습니다. 영상 서비스의 경우 상황은 더 나빴습니다. HBO Max에서 어시스턴트는 "누가 시청 중인가요(Who's Watching)" 화면만 열 수 있었고, 그러면서도 시리즈가 "이미 재생 중"이라고 주장했습니다(이는 거짓말이었습니다). 또한 시리즈를 "재개"하는 대신 자연의 소리를 재생했습니다.
| Amazon의 2025년 2월 26일 약속 | 독립 테스트 결과 | 출처 |
|---|---|---|
| "전문가(experts)" 아키텍처가 "수만 개의 서비스와 장치"를 조율함 | Charli XCX를 요청했을 때 The Black Keys 대신 Sombr의 "Back to Friends"가 재생됨, Alabama Shakes가 재생됨 | WIRED, 2026년 3월 6일 |
| ... | ... | ... |
공정하게 말하자면, 진전은 있습니다. Trusted Reviews (2026년 3월 28일)는 Alexa+가 많은 부분에서 발전했지만 "여전히 비틀거린다"고 인정했으며, T3 (2026년 4월)는 어시스턴트가 "요청을 실제 동작으로 전환한다"고 언급했습니다. 두 리뷰 모두 신뢰성에 대한 단서를 남겼습니다. 하지만 "많은 부분에서 발전했다"와 "항상 작동한다"는 서로 다른 이야기이며, 일상적인 명령을 수행하는 데 있어 중요한 것은 후자입니다.
여기서 저를 불쾌하게 만드는 점은 어시스턴트의 오류가 매우 확신에 찬 어조로 전달된다는 것입니다. 텍스트 채팅은 환각 (Hallucination)을 일으키더라도 사용자가 텍스트를 보고 재확인할 수 있습니다. 하지만 스피커가 시리즈가 "이미 재생 중"이라고 활기차게 알려준다면, 그것은 인터페이스의 오류가 아니라 공개적으로 하는 거짓말입니다.

Amazon이 약속한 것 - 그리고 얼마에 판매되었는가
요약하자면: 2025년 2월 26일의 발표는 생성형 AI (Generative AI)를 기반으로 어시스턴트를 완전히 재구축하겠다고 약속했습니다. 가격은 월 $19.99이며, Amazon Prime 구독자에게는 무료, 즉 구독에 포함되어 제공됩니다. 이 프레임워크는 Amazon의 발표와 2026년 7월까지의 회사 문서에 근거합니다.
판매 수치는 강력했습니다. 발표 시점에 전 세계적으로 Alexa가 탑та된 기기는 스피커, 자동차, 오피스, Fire TV, Prime Video를 포함하여 6억 대 이상이었으며, Andy Jassy는 2026년 4월 주주 서한에서도 이 수치를 재확인했습니다. 초기 액세스(Early Access)는 2025년 3월 미국에서 시작되었고, Consumer Reports는 2025년 10월이 되어서야 이를 접할 수 있었으며, Early Access 프로그램은 "적어도 2026년 1월까지" 지속되었습니다. 2026년 초부터 Alexa+는 미국의 모든 Prime 구독자에게 제공되었으며, Echo 소유자들은 단순히 새로운 버전으로 자동 전환되었습니다. 이전 버전으로 되돌리는 것은 "exit Alexa+" 명령어로 가능하지만, WIRED가 지적했듯이 이 옵션이 얼마나 오래 유지될지는 불분명합니다.
테스터들이 여전히 환각 (hallucinations) 현상을 겪고 있는 상황에서 사용자들을 새로운 버전으로 자동 전환하는 것은 대담한 행보입니다. 마케팅 퍼널 (funnel) 관점에서는 이해가 가지만, 아이에게 만화를 틀어달라고 요청한 사람의 입장에서는 논란의 여지가 있습니다.
Amazon은 스스로 문제를 인정하고 있는가?
짧게 답하자면, 공개적으로는 아닙니다. 2025년 주주 서한에서 Andy Jassy는 성장 지표를 제시하고 있는데, 이는 회사의 주장일 뿐 독립적인 검증 결과가 아닙니다. Business Insider가 입수한 내부 문건은 다른 그림을 보여줍니다. "가장 비용이 많이 드는" 새로운 이니셔티브인 Alexa+, 이 프로젝트의 축소 논의, 그리고 과도한 지출에 대한 경영진의 불만 등이 담겨 있습니다.
서한에 기재된 지표는 다음과 같습니다: 사용자는 Alexa와 2배 더 많이 대화하고, 기기를 통한 구매는 3배 더 빈번해졌으며, 음악 스트리밍은 25% 증가했고, 스마트 홈 사용은 50% 더 잦아졌습니다. Jassy는 "우리는 그녀의 뇌를 완전히 재프로그래밍해야 했습니다"라고 솔직하게 덧붙이며, "Alexa는 여전히 여정의 시작 단계에 있다"고 인정했습니다. 수치들은 화려하지만, 주목해야 할 점은 이 모든 것이 사용 빈도에 관한 것이지 명령 수행의 정확도에 관한 것은 단 하나도 없다는 사실입니다.
Alexa+의 초기 역사는 순탄치 않았습니다. 출시가 여러 차례 연기되었고, 베타 테스터들은 환각 (hallucinations) 현상과 이상한 동작을 경험했습니다. 문서화된 가장 비극적인 사례는 한 테스터가 Alexa가 어항의 필터를 꺼버려 물고기들이 죽었다고 보고한 사건입니다. Amazon은 해당 문서에 대한 논평을 거부했습니다.
"단순한 명령"을 고치는 데 드는 비용은 얼마인가?
요약: Business Insider가 Amazon의 내부 계획 문서를 인용해 보도한 바에 따르면, Moonraker 프로젝트의 GPU 비용 전망치는 2026년 한 해에만 1억 달러(약 1,300억 원)를 상회합니다. 이 프로젝트를 위해 수백 개의 Nvidia GPU가 할당되었으며, 엔지니어들은 Anthropic의 Sonnet 모델로 이를 테스트했습니다. 또한 문서 내에서는 프로젝트를 연기하거나 축소하는 방안이 직접적으로 논의되었습니다.
“음악 틀어줘”와 같은 명령에 왜 이렇게 많은 하드웨어가 필요한 걸까요? 현재 Alexa+의 에이전트 시나리오(Uber 및 Ticketmaster를 통한 여행 및 티켓 예약)는 단일 단계(one-step) 방식입니다. 즉, 하나의 요청이 하나의 동작으로 이어집니다. 반면 Moonraker는 OpenAI, Google, Anthropic의 에이전트 제품들이 하는 것처럼 여러 동작을 하나의 체인(chain)으로 연결하도록 설계되었습니다. TNW는 이를 악의적이고 정확하게 평했습니다. “음성 비서들은 지난 10년 동안 우리의 명령을 수행하겠다고 약속해 왔지만, 실제로는 대부분 단순히 타이머를 설정하는 수준이었다.”
Amazon의 전반적인 AI 투자 규모를 고려하면 이 금액은 다르게 보입니다. Jesse에 따르면, 회사의 2026년 자본 지출(CAPEX)은 약 2,000억 달러(주로 AWS 관련)에 달하며, 잉여 현금 흐름은 380억 달러에서 110억 달러로 급감했습니다. 이는 “주로 AI 관련 자본 지출 증가 때문”입니다. 이러한 배경에서 Moonraker에 투입되는 1억 달러는 작은 부분에 불과하지만, 이는 시사하는 바가 큽니다. 이 정도의 자금을 투입하고도 “단순한 명령”은 해결된 과제가 아니라 여전히 비밀 프로젝트 단계에 머물러 있다는 증상이기 때문입니다.
사람들이 실제로 “알리사”에게 요청하는 것은 무엇인가?
요약: Yandex는 2017년 10월 10일에 알리사(Alisa)를 출시했으며, 출시 첫날부터 날씨 예보와 “요청에 따라 음악 재생”과 같은 시나리오, 즉 바로 그 “단순한 명령”들이 포함되어 있었습니다. 2026년 7월까지 알리사는 Alice AI 모델 제품군을 기반으로 한 무료 채팅 서비스인 “알리사 AI(Alisa AI)”로 재포장되었습니다. 하지만 일상적인 요청의 핵심 골격은 변하지 않았습니다.
그리고 바로 이 골격이 이 기사의 핵심 논거입니다. “알리사, ~를 틀어줘...”는 발표 자료에 나오는 깔끔한 명령어가 아니라 ‘롱테일(long tail)’의 영역입니다. 아이들은 오타가 섞인 만화 제목을 말하고, 성인들은 노래 가사 한 구절로 곡을 찾으며, 할머니는 자신이 사는 도시의 날씨를 묻습니다. 어시스턴트는 이 모든 롱테일 요청을 처리할 수 있어야 하며, 그렇지 못하다면 할 수 없다고 인정해야 합니다. 아래는 사람들이 음성 비서에게 전달하는 실제 문구들에 대한 솔직한 분석입니다.
클러스터 검색어 사전: 사람들이 이 주제와 함께 무엇을 더 검색하는가
요약하자면: "알리사, 켜줘" 주변에는 어린이용 만화, 인공지능 (AI) 커버곡, 터키 드라마, 도시별 날씨, 그리고 전문가 강좌까지 모든 것이 뒤섞여 있습니다. 이것들이 실제로 무엇인지 그룹별로 분석해 보겠습니다.
날씨, 시간 및 일상생활
- "첼랴빈스크 온도가 몇 도야" 및 "옴스크에 비가 올까" - 자신의 도시에 대한 예보; 크라스노야르스크, 사마라, 사라토프, 쿠르스크에서도 동일한 패턴이 나타납니다.
- "볼고그라드 시간", "바르나울 날씨", "키로프 온도" - 다시 날씨와 시계 관련 질문; 하바롭스크와 니즈니 노브고로드에서도 묻습니다.
- "1루블에 몇 텡게야" 및 "우즈베키스탄은 지금 몇 시야" - 인접 국가의 통화 및 시간.
- "1인치는 몇 센티미터야" - 일상적인 단위 변환; 주로 알리사로 32인치 TV를 구매하기 전에 검색합니다.
- "생크림으로 크림 만드는 법" - 주방에 있는 스피커에 던지는 요리 질문.
- "이 새는 뭐야" - 새의 울음소리를 듣고 종을 식별해 달라는 요청.
만화 및 어린이
- "블라드 A4 틀어줘" - 어린이 블로거로, 미취학 아동들의 음성 요청 챔피언입니다.
- "퍼피 구조대", "닌자 거북이", "스폰지밥" - 아이들이 음성으로 주문하는 애니메이션 시리즈.
- "미스터 맥스", "레이디 다이애나", "니키타 만화" - 어린이 블로거 및 캐릭터.
- "스키비디 토일렛 (Skibidi Toilet)" - 밈 (Meme) 시리즈; 이와 함께 애니메이션 소녀나 속옷 관련 검색이 나타나는데, 플랫폼에서 필터링하는 항목들입니다.
- "알리사, 너 똥이지" - 스피커와 대화하는 아이들의 민속적 표현: 아이가 스피커가 화를 내는지 확인해 보는 것입니다.
- "발레리나 카푸치나" - '이탈리안 브레인롯 (Italian Brainrot)' 캐릭터; 만화와 AI 생성물 모두를 검색합니다.
- "드루조크 (Druzhok)" - '바르보스키니 (Barboskiny)'와 팬들이 만든 AI 이야기: "옴스크 시의 드루조크", "마인크래프트에 들어간 드루조크" 등.
음악 및 커버곡
- «включи Бутырку» (Butyrka 틀어줘) - 장르적 요청으로, 사람들이 스피커에 실제로 이렇게 말함.
- «я экспонат, ты мой фанат» (나는 전시물, 너는 나의 팬) - 후렴구 가사 한 줄로 트랙을 검색함.
- «алмаз» (다이아몬드) 및 «подорожник» (질경이) - Alisa Mona의 노래들; 가수의 이름이 어시스턴트(Alisa)의 이름과 일치하여 검색 결과가 혼재됨.
- «обработай песню Летова» (Letov의 노래를 처리해줘) - Yegor Letov의 AI 처리(AI-processing); 이와 함께 «оживи легенду» (전설을 살려내라) - 신경망(Neural network)으로 재구성된 Viktor Tsoi의 뮤직비디오가 검색됨.
- «комиссар, ты уйдёшь» (Commissar, 당신은 떠날 거야) - 그룹 «Commissar»의 최신 커버곡.
- «малиновая» (라즈베리) 및 «забава» (Zabava) - 신경망이 음악을 입힌 Yesenin의 시.
- «шилец» (Shilets) - Eduard Shilets의 노래 AI 커버.
- «голос Крида» (Krid의 목소리) 및 «новая песня Миланы» (Milana의 신곡) - Egor Kreed의 목소리로 더빙한 것, Milana Khametova와 Sonya Safarova의 최신 트랙.
- «ты пчела, я пчеловод» (너는 벌, 나는 양봉업자) - 노래 가사 전체를 비밀번호처럼 입력하여 요청함.
- «между нами молния» (우리 사이의 번개), «слезы льёт лёд» (얼음이 눈물을 흘린다), «я не черта» (나는 악마가 아니야) - 트랙을 찾기 위해 사용하는 제목의 파편들.
- «нелюбовь» (비사랑) - 노래 «Нелюбовь»에 맞춘 AI 댄스 생성을 요청함.
- «добрый молодец» (용맹한 청년) 및 «модерн токинг» (Modern Talking) - 신경망 커버: 민속 ВИА(Vocal-Instrumental Ensemble) 및 Modern Talking.
- «вокс» (Vox) - 두 가지 의도(Intent)가 섞임: 노래와 해당 이름의 AI 채팅.
- «мику» (Miku) - Hatsune Miku의 목소리로 텍스트를 더빙.
- «пучок» (번/똥머리) - «волосы в пучок» (머리를 번 스타일로) 뮤직비디오 및 이를 기반으로 한 AI 처리.
- «бардии» (Bardia들) - «AI Bardia와 함께하는 노래» 생성; 서비스 이름을 통해 검색함.
- «сунн интеллект» (Sunn intellect) - 음악 생성기인 Suno를 키보드로 오타 입력한 형태.
- «мьюзик» (Music) - Musicful과 같은 음악 생성기: 버전 및 무료 이용 방법.
- «таллиса» (Tallis) - «Tallis와 상상 속 음악가들»: 이미 사람들이 노래를 찾고 있는 Suno의 가상 아티스트.
- «отчаянные домохозяйки» (위기의 주부들) - 등장인물들의 목소리로 드라마를 AI 더빙.
- «пародия» (패러디) 및 «плюсовки» (Plusovki) - 노래 패러디 및 플러스오프카(Plusovka, 보컬 포함 버전)를 온라인에서 마이너스오프카(Minusovka, 반주 버전)로 변환.
드라마, 영화 및 도서
- «디리리쉬(dirilish)» - 터키 드라마 «부활한 에르투그룰(Resurrection: Ertugrul)»; 청각적으로 들리는 대로 입력된 명칭.
- «호자이카(khozyayka, 주인/여주인)」 - 신경망 (Neural Network)에 관한 영화 「호자이카」; 시청 경로를 검색.
- «로드필름(lordfilm)» 및 «로드(lord)» - 불법 스트리밍의 흔적: 「네이로바튜(Neyrobatyu)」와 「네이로 바샤(Neyro Vasya)」를 로드필름에서 무료로 검색.
- «상어 공포 영화 틀어줘» - 저녁 시간대 비디오 요청; 공포 (Horror) 장르는 음성 요청 상위권을 꾸준히 유지.
- «트레일러(trailer)» - 이중 의도: "새 트레일러를 보여줘"와 "신경망 (Neural Network)으로 트레일러를 만들어줘" 사이의 모호함.
- «윌 스미스(will smith)» - 윌 스미스 출연 영화 및 초기 비디오 모델 (Video Model)의 스파게티 먹는 불멸의 밈 (Meme).
- «칭기즈(chingiz)» - 칭기즈 압둘라예프의 추리 소설 오디오북 및 칭기즈칸 관련 영화.
- «이스킨(iskiny, 인공지능 인격체)» - SF 소설 속 「이스킨(iskin)」: 도서 검색 시 지식 베이스를 갖춘 AI를 지칭하는 용어.
- «무소프시키(musorshchiki, 쓰레기 수거꾼)」 및 «코스모스-신경망(kosmos-neyroset)» - 아마추어 「포파단치(popadantsy, 이세계 전이물)」: 우주, 쓰레기 수거꾼, 신경망 (Neural Network)에 관한 읽을거리.
- «꿈해몽-신경망(sonnik-neyroset)» - AI를 통한 꿈 해몽.
- «치탈키(chitalki, 리더/낭독기)» - 책을 "역할별로" 읽어주는 음성 엔진 낭독기.
- «롤플레이(rolevki)» - 애니메이션부터 가공의 영웅까지, AI 캐릭터와의 채팅 및 역할극 (Role-play).
- «옵티머스(optimus)» - Tesla Optimus 로봇: 가격 및 기능.
- «혼다 뉴로(honda neyro)» - 매뉴얼 및 리뷰 검색; 상표명이며 어시스턴트 (Assistant)와는 관련 없음.
강좌, 구루 및 "무료"
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기