37signals의 클라우드 리패트리에이션(Cloud Repatriation)이 AI 인프라에 대해 우리에게 가르쳐준 것
요약
37signals는 퍼블릭 클라우드에서 온프레미스로 워크로드를 전환하는 '클라우드 리패트리에이션'을 통해 연간 약 200만 달러의 비용을 절감했습니다. 하드웨어 투자 비용을 18개월 이내에 회수하였으며, 이러한 경제적 논리가 향후 컴퓨팅 집약적인 AI 인프라 구축에도 적용될 수 있는지에 대한 시사점을 제공합니다.
핵심 포인트
- 클라우드 리패트리에이션을 통해 연간 클라우드 지출을 약 320만 달러에서 130만 달러로 대폭 감소시킴
- 약 70~80만 달러의 하드웨어 투자로 18개월 이내에 투자금 회수(Payback) 달성
- 지속적인 규모(Sustained scale)를 가진 워크로드의 경우 인프라 소유가 임대보다 경제적임
- AI 인프라와 같은 고성능 컴퓨팅 환경에서도 동일한 경제적 논리가 유효할지 검토 필요
2023년, 37signals는 퍼블릭 클라우드(Public Cloud)를 완전히 떠났다고 발표했으며, 이어서 클라우드 리패트리에이션(Cloud Repatriation, 클라우드에서 온프레미스로 복귀) 과정을 공개적으로 문서화함으로써 대규모 온프레미스(On-premises) 경제성의 가장 명확한 실제 사례 중 하나를 제공했습니다. 클라우드 마이그레이션(Migration)을 되돌리고 워크로드(Workloads)를 프라이빗 클라우드(Private Cloud) 인프라로 전환함으로써, 이 회사는 연간 클라우드 인프라 지출을 거의 200만 달러 가까이 대폭 절감했습니다. 수치의 투명성은 이 사례를 매우 설득력 있게 만들었습니다. 2022년에 37signals는 클라우드 서비스에 3,201,564달러를 지출했으며, 이는 월간 약 266,797달러에 해당합니다. 공개된 하드웨어 투자 및 회수 기간(Payback timelines)과 함께 제공된 이러한 상세한 비용 내역은 대규모 클라우드 리패트리에이션의 재무적 메커니즘을 들여다볼 수 있는 드문 기회를 제공했습니다. 범용 SaaS 워크로드의 경우 계산은 명확했습니다. 하지만 동일한 논리는 차세대 컴퓨팅 집약적(Compute-heavy) 시스템에 대해 중요한 질문을 던집니다: “경제적 논리가 AI 인프라에도 적용되는가?” 이 글에서 우리는 동일한 경제적 논리가 AI 인프라에도 유효한지 검토합니다.
요약(TL;DR): 37signals는 2022년에 AWS에 연간 약 320만 달러를 지출했습니다. 워크로드를 자체 인프라로 리패트리에이션한 후, 클라우드 지출은 2024년까지 약 130만 달러로 감소했습니다. 회사는 서버에 약 70만~80만 달러를 투자했으며, 18개월 이내에 비용을 회수했습니다. 전체 인프라는 여전히 동일한 10명 규모의 팀에 의해 운영됩니다. 추가적인 운영 오버헤드(Operational overhead)는 없습니다. 핵심 요점은 지속적인 규모(Sustained scale)에서는 인프라를 소유하는 것이 임대하는 것보다 훨씬 저렴할 수 있다는 것입니다.
37signals 플레이북: Hanson이 실제로 문서화한 내용: 2022년에 37signals는 AWS에 연간 320만 달러를 지출했습니다. 2023년에 클라우드를 떠난 후, 연간 비용은 2024년까지 약 130만 달러로 감소하여 연간 거의 200만 달러를 절감했습니다. 전환을 위해 Dell 서버에 약 600,000달러의 하드웨어 투자가 필요했습니다.
해당 기업은 18개월도 채 되지 않아 투자금을 전액 회수했으며, AWS 예약 인스턴스 (Reserved Instance) 계약이 만료된 2023년 하반기에 완전한 비용 회수 (Payback)를 달성했습니다. 그 시점부터 절감된 비용은 자본 지출 (Capital Expense)을 상쇄하는 대신 영업 이익률 (Operating Margin)로 직접 반영되었습니다. 37signals는 하드웨어 비용을 150만 달러, 연간 운영 비용을 약 20만 달러로 예상했습니다. 이러한 전환을 통해 매년 반복되던 130만 달러의 클라우드 스토리지 비용이 일회성 자본 지출과 아주 적은 수준의 지속적인 운영 비용으로 대체되었습니다. 5년 기준으로 37signals는 총 절감액 예상치를 700만 달러에서 1,000만 달러 이상으로 상향 조정했습니다. 연도별 37signals의 클라우드 탈출 재무 현황: 37signals의 클라우드 탈출이 시간에 따라 미치는 재무적 영향을 설명하기 위해, 아래 표는 연간 클라우드 지출, 온프레미스 (On-premises) 하드웨어 투자 및 운영 비용을 세분화하여 결과적인 순 절감액과 주요 운영 참고 사항을 보여줍니다.
| 연도 | 클라우드 지출 | 하드웨어 투자 | 운영 비용 | 비고 |
|---|---|---|---|---|
| 2022 (기준점) | 약 $3.2M | $0 | 클라우드 지출에 포함됨 | 완전한 클라우드 의존성 |
| 2023 (마이그레이션) | 약 $2M | 약 $700–800K | 보통 | 하드웨어 비용을 18개월 이내에 전액 회수 |
| 2024+ (리패트리에이션 이후) | 약 $1.3M | 약 $1.5M (스토리지) | 연간 약 $200K | 연간 약 $1.9M 절감 |
| 2025+ (최소한의 AWS 의존성) | 약 $1.5M (Pure Storage, 18PB) | 연간 약 $200K | 5년 예상 절감액 $10M+ |
주목할 점은, 이번 마이그레이션이 팀의 운영 확장을 요구하지 않았다는 것입니다. 10명 규모의 인프라 팀이 새로운 인력 충원 없이 전체 리패트리에이션 (Repatriation) 과정을 처리했습니다. 운영 오버헤드 (Operational Overhead)에 대한 일반적인 우려에 대해 37signals의 공동 창립자인 David Heinemeier Hansson은 다음과 같이 언급했습니다: "클라우드를 떠난 지 이제 겨우 1년 남짓 되었지만, 모든 것을 관리하는 팀은 여전히 동일합니다. 우리가 클라우드 탈출을 발표했을 때 일부 관망자들이 추측했던 것처럼, 팀 규모를 급격히 늘려야 할 만큼 탈출과 관련된 추가 업무라는 '숨겨진 용 (Hidden Dragons)'은 없었습니다."
“우리의 '대규모 클라우드 탈출(Big Cloud Exit) FAQ'에 담긴 모든 답변은 여전히 유효합니다.” 이는 퍼블릭 클라우드 (Public Cloud) 환경에서 벗어나는 것이 필연적으로 훨씬 더 큰 인프라 팀을 필요로 한다는 일반적인 가설에 정면으로 도전합니다. 실행 과정은 '중요도 사다리 (criticality ladder)' 전략을 따랐으며, 팀은 위험도가 낮은 서비스부터 먼저 마이그레이션(Migration)하고 더 중요한 서비스는 나중에 옮겼습니다. 팀은 HEY 이메일 시스템을 캐싱 (Caching), 데이터베이스 (Database), 그리고 마지막으로 잡 서비스 (Job services) 순으로 단계별로 이동시켰습니다. 리스크를 최소화하기 위해, 그들은 클라우드 리패트리에이션 (Cloud Repatriation) 과정 중 롤백 (Rollback) 능력을 보존할 수 있도록 AWS 리전 (Region)에서 약 1밀리초 이내의 거리에 인프라를 코로케이션 (Colocation)했습니다. 시스템을 안정화한 후, 그들은 연간 합계 50만 달러를 초과하는 RDS 및 관리형 Elasticsearch를 포함하여 상당한 반복 비용이 발생하는 관리형 서비스 (Managed Services)를 교체했습니다. 37signals의 사례 연구가 중요한 이유는 공개적으로 문서화된 비용 효율성 때문입니다. 특히 스토리지 (Storage) 비용과 관리형 서비스와 관련하여 장기적인 클라우드 도입 가설에 의문을 제기하는 조직들에게, 37signals의 문서는 비교를 위한 드문 기준점 (Baseline)을 제공합니다.
AI 인프라 경제학이 훨씬 더 극단적인 이유
37signals의 클라우드 리패트리에이션에서 얻은 교훈은 AI 인프라에 적용될 때 더욱 날카로운 양상을 띱니다. 더 높은 GPU 비용, 예측 가능한 추론 (Inference) 워크로드, 거대한 임베딩 (Embedding) 스토리지, 그리고 더 엄격한 데이터 규제는 워크로드를 가장 적절한 곳으로 이동시킬 수 있는 온프레미스 (On-premises) 또는 하이브리드 클라우드 (Hybrid Cloud) 솔루션의 이점을 증폭시키는 재무적 및 운영적 압박을 만들어냅니다. 아래에서는 주요 동인들을 분석합니다.
AI 인프라 비용 비교
다양한 AI 인프라 접근 방식의 비용 영향을 평가하기 위해, 아래 표는 클라우드, 온프레미스, 그리고 하이브리드 구성에 대한 초기 설정 비용, 다양한 워크로드에서의 월간 운영 비용, 그리고 예상 손익분기점 (Break-even) 시점을 비교합니다.
| 설정 비용 | 월간 비용 | 손익분기점 |
|---|---|---|
| 클라우드 GPU 대여 (AWS/ Azure) | $0 | $2,900–3,500 (8h/day × $4–8/hour × 15 days) |
| 클라우드 추론 API (Lambda Labs) | $0 | $1,800–2,500 (8h/day × $3.67/hour × 15 days) |
| 자체 구축 GPU (8×H100 서버) | $200K–400K | $1,500–2,000 (전력 + 유지보수) |
| 하이브리드 (클라우드 학습 + 온프레미스) | $200K–400K | 학습 비용만 발생, 추론 비용은 최소화 |
참고: 클라우드 GPU 대여의 경우, GPU당 하루 8시간 사용을 가정하여 월간 비용을 추정했습니다. 비용은 사용률에 따라 선형적으로 증가하며, 쿼리당 직접 부과되는 방식이 아닙니다.
-
GPU 클라우드의 마진(Markup)은 높습니다
AI 워크로드 (AI workloads)는 GPU에 크게 의존하며, 클라우드 제공업체는 일반적인 CPU 컴퓨팅보다 GPU 용량에 대해 훨씬 더 높은 프리미엄을 부과합니다. H100 GPU를 탑재한 AWS의 온디맨드 (On-demand) P5 인스턴스는 GPU 시간당 약 $4–8인 반면, 유사한 Azure H100 인스턴스는 시간당 약 $3.67입니다. 이와 대조적으로, 스팟 마켓 (Spot markets) 및 Lambda Labs와 같은 대안 제공업체는 유사한 GPU 용량을 시간당 $1–2, 또는 예약 약정 (Reserved commitments) 시 $1.85–2.49에 제공합니다. 그 결과, 하이퍼스케일러 (Hyperscaler)의 온디맨드 GPU 용량은 스팟 또는 특화된 GPU 클라우드 시장에 비해 4~8배의 마진이 붙게 됩니다. 즉, 클라우드 제공업체가 하이엔드 AI 컴퓨팅에 부과하는 프리미엄은 일반적인 CPU 클라우드 마진보다 훨씬 더 큽니다. 지속적인 추론 워크로드를 실행하는 조직의 경우, 이러한 가격 격차는 AI 인프라에서 지배적인 비용 동인이 됩니다. -
예측 가능한 추론은 GPU 소유를 경제적으로 만듭니다
AI 추론 (Inference) 워크로드는 이례적으로 예측 가능하기 때문에 높은 GPU 가격이 특히 중요해집니다. H100 GPU를 직접 구매하는 것이 비용 효율적일 수 있습니다. 단일 GPU는 약 $25K–40K이며, 완전한 8×H100 서버는 $200K–400K 범위입니다. Lenovo의 분석에 따르면, 매일 6시간 이상 지속적으로 사용하면 첫 해 내에 AWS 대비 투자 회수 (Payback)가 가능합니다. 이 손익분기점 (Break-even)이 이렇게 빨리 도달하는 이유는 AI 추론 워크로드가 이례적으로 예측 가능하기 때문입니다.
하루 종일 변동하는 SaaS 트래픽과 달리, 추천 엔진 (Recommendation engines)과 같은 프로덕션 AI 시스템은 일정한 양의 요청을 처리하는 경향이 있습니다. 이러한 예측 가능성은 경제성을 변화시킵니다. 인프라가 일관된 사용률 (Utilization)로 작동할 때, 소유한 하드웨어는 워크로드 전반에 걸쳐 효율적으로 상각 (Amortized)될 수 있습니다. 팀이 거의 사용하지 않는 버스트 용량 (Burst capacity)을 위해 클라우드 프리미엄을 지불하는 것은 불필요해집니다. 지속적으로 추론 (Inference)을 실행하는 조직의 경우, 하드웨어 투자 비용은 종종 12개월 이내에 회수됩니다. 그 시점부터는 절감액이 37signals가 기록한 것과 동일한 패턴을 보입니다. 즉, 지속적인 임대료 대신 고정된 인프라를 사용하는 것입니다.
-
임베딩 (Embedding) 저장 요구 사항은 막대합니다. GPU 연산 (Compute)이 최적화된다 하더라도, AI 시스템은 또 다른 급격히 증가하는 비용 계층인 임베딩 저장 요구 사항을 도입합니다. 벡터 데이터베이스 (Vector databases)는 검색, 검색 (Retrieval), 추천에 사용되는 고차원 임베딩을 저장합니다. 데이터 세트가 수백만 또는 수십억 개의 레코드로 확장됨에 따라 저장 요구 사항도 빠르게 확장됩니다. 예를 들어, 1,536 차원의 벡터 1,000만 개는 최소 58GB의 로우 스토리지 (Raw storage)가 필요하며, 인덱스 (Indexes)와 메타데이터 (Metadata)를 포함하면 종종 200~300GB에 달합니다. Pinecone과 같은 클라우드 스토리지 서비스는 GB당 월 $0.33를 부과하며, 이는 500GB의 경우 쿼리를 수행하기도 전에 월 $165의 비용이 발생할 수 있음을 의미합니다. pgvector를 사용하는 PostgreSQL과 같은 셀프 호스팅 (Self-hosted) 솔루션은 민감한 데이터를 직접 제어하면서 클라우드 지출을 극적으로 줄여줍니다. 시간이 지남에 따라 이러한 저장 요구 사항은 GPU 연산과 함께 인프라 비용을 복리로 증가시키며, 셀프 호스팅 또는 하이브리드 아키텍처 (Hybrid architectures)의 경제적 이점을 더욱 강화합니다.
-
데이터 주권 (Data sovereignty) 및 컴플라이언스 (Compliance)는 온프레미스 (On-premises) 배포에 유리합니다. 산업이 점점 더 규제됨에 따라 데이터 거주성 (Data residency) 규정과 일반적인 컴플라이언스는 AI 분야의 우선순위가 되고 있습니다. 특히, EU AI Act는 AI 시스템에 대한 엄격한 규제를 도입했으며, 특정 AI 사용 사례에 대한 금지 조치가 2025년 2월부터 시행되었습니다. 온프레미스 배포는 컴플라이언스 준수를 단순화합니다.
복잡한 규제 환경을 헤쳐나가는 금융 기관의 경우, Actian의 Data Intelligence 플랫폼과 같은 솔루션은 데이터 거버넌스 (Data Governance)를 강화하고 컴플라이언스 (Compliance) 워크플로우를 간소화하는 데 도움을 줍니다. 클라우드 인프라 사례 연구: 37signals가 입증한 것. 37signals의 클라우드 탈출 (Cloud Exit)이 보여준 재무적 투명성이 파격적이었던 만큼, 그들의 리패트리에이션 (Repatriation)은 고립된 사례가 아니었습니다. 이는 비용 통제력을 되찾고 클라우드 인프라를 최적화하려는 많은 조직의 증가하는 추세 중 일부였습니다. 많은 유명 사례 연구들은 워크로드 (Workload)를 퍼블릭 클라우드 (Public Cloud)에서 자체 소유 또는 하이브리드 인프라 (Hybrid Infrastructure)로 다시 이동시키는 규모와 경제성을 보여줍니다. Dropbox Dropbox는 일찍이 2015년에 엔터프라이즈 클라우드 리패트리에이션 (Cloud Repatriation)을 개척했으며, 2016년에서 2018년 사이에 마이그레이션 (Migration)을 완료했습니다. 이 회사는 약 90%의 고객 데이터(보고된 바에 따르면 500 페타바이트 이상)를 AWS에서 세 곳의 자체 코로케이션 (Colocation) 시설로 이동했습니다. 인프라 투자액은 총 5,300만 달러였으나, Dropbox의 2018년 S-1 공시 서류에 따르면 2년 동안 7,460만 달러의 운영 비용 절감을 보고했습니다. 주로 유럽 고객과 특화된 서비스를 포함한 소량의 워크로드는 AWS에 남아 있습니다. 내부적으로 이 이니셔티브 (Initiative)는 “Magic Pocket”으로 알려져 있었으며, 이는 잘 실행된 하이브리드 클라우드 (Hybrid Cloud) 접근 방식이 장기적인 비즈니스 목표와 일치하면서도 어떻게 상당한 비용 절감을 가져올 수 있는지를 보여주는 전형적인 사례입니다. Ahrefs SEO 도구 회사인 Ahrefs는 850대의 서버를 갖춘 싱가포르 코로케이션 (Colocation) 설정을 활용했습니다. 퍼블릭 클라우드를 피함으로써 얻은 보고된 절감액은 2.5년 동안 약 4억 달러였습니다. 실제 인프라 비용은 850대 서버에 대해 3,950만 달러(서버당 월 약 $1,500)였으며, 이는 전체를 AWS에서 호스팅했을 경우의 추정치인 4억 4,770만 달러(서버당 월 약 $17,557 상당)와 대조됩니다.
Ahrefs는 다음과 같이 말했습니다: “만약 우리 제품이 100% AWS 상에서만 운영되었다면, 우리는 수익을 내지 못했을 것이며 존재조차 할 수 없었을 것입니다.” 비판론자들은 Ahrefs가 AWS 비용 추정치를 부풀렸다고 주장하지만, 비용 절감의 방향성만큼은 부정할 수 없었으며, 이는 신중한 계획이 뒷받침된다면 대규모 환경에서도 클라우드 리패트리에이션 (Cloud Repatriation)의 과제들을 극복할 수 있음을 보여줍니다. GEICO는 10년 동안 여러 클라우드 제공업체로 마이그레이션 (Migration)을 진행했으나, 비용이 예상치를 2.5배 초과하여 2022년 기준 8개 제공업체에 걸쳐 3억 달러에 달하게 되었습니다. 이에 대응하여 GEICO는 OpenStack과 Kubernetes를 사용하여 워크로드 (Workload)를 프라이빗 클라우드 (Private Cloud)로 이동하기 시작했으며, 2029년까지 50% 이상의 리패트리에이션을 목표로 하고 있습니다. 초기 결과에 따르면 퍼블릭 클라우드 (Public Cloud) 서비스와 비교했을 때 컴퓨팅 비용은 50%, 스토리지 (Storage) 기가바이트당 비용은 60% 감소한 것으로 나타났으며, 이는 하이브리드 클라우드 (Hybrid Cloud) 아키텍처가 어떻게 효율성, 컴플라이언스 (Compliance), 그리고 장기적인 비즈니스 목표와의 정렬을 달성할 수 있는지를 입증합니다. Akamai는 컴퓨팅 워크로드를 35만 대 이상의 서버로 구성된 자체 글로벌 에지 네트워크 (Edge Network)로 마이그레이션하기 전, 제3자 클라우드 서비스에 1억 달러 이상을 지출할 경로에 있었습니다. 이 마이그레이션은 연간 약 1억 달러의 비용 절감을 가져왔으며, 이는 기존 인프라와 규모가 일치할 때 리패트리에이션의 경제성이 얼마나 강력한지를 증명합니다. 이러한 사례들이 공유하는 점은 37signals가 기록한 것과 동일한 경제적 패턴입니다. 예측 가능하고 대량인 워크로드는 결국
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기