이제 데이터 웨어하우스도 볼 수 있습니다: SQL에 도입된 멀티모달 AI (Multimodal AI)
요약
Snowflake가 Cortex AI를 통해 SQL 엔진 내에서 이미지, 오디오 등 비정형 데이터를 직접 분석할 수 있는 멀티모달 함수를 출시했습니다. 이를 통해 복잡한 외부 파이프라인 없이 SQL 쿼리만으로 비정형 데이터 추론이 가능해져 데이터 스택이 획기적으로 단순화됩니다.
핵심 포인트
- SQL 명령어로 이미지 및 비디오 콘텐츠 직접 분석 가능
- 외부 파이프라인 제거로 데이터 스택 단순화 및 보안 강화
- 기존 방식 대비 성능 30% 향상 및 비용 최대 60% 절감
- 데이터 분석가의 AI 활용 능력 및 접근성 민주화
이미지나 오디오와 같은 비정형 데이터 (unstructured data)에 대해 추론 (inference)을 수행한다는 것은 항상 데이터 웨어하우스 (data warehouse)를 떠나야 함을 의미했습니다. 별도의 파이프라인을 구축하고, Python 서비스를 관리하며, 시스템 간의 데이터 이동을 오케스트레이션 (orchestrate)해야 했습니다. 그러한 패턴이 무너지기 시작하고 있습니다. Snowflake가 Cortex AI에서 멀티모달 함수 (multimodal functions)를 출시함에 따라, 이제 데이터가 존재하는 바로 그곳에서 익숙한 SQL 명령어를 사용하여 이미지 및 비디오 콘텐츠를 분석할 수 있습니다.
이것은 단순한 외관상의 변화가 아닙니다. 이는 우리가 비정형 데이터 파이프라인을 어떻게 생각해야 하는지에 대한 근본적인 변화를 나타냅니다. 핵심은 이미지 분류 (image classification)나 비디오 분석과 같은 작업을 위해 우리가 구축했던 복잡한 다중 서비스 아키텍처 (multi-service architectures)를 이제 단일 SQL 쿼리 (SQL query)로 획기적으로 단순화할 수 있다는 것입니다. 이는 스택 (stack)을 붕괴시키고, 보안을 강화하며, SQL을 아는 모든 분석가에게 강력한 AI 기능을 제공합니다.
무엇이 바뀌었나
Snowflake는 Cortex AI Functions라고 불리는 일련의 기능들을 통해 멀티모달 AI 기능을 SQL 엔진에 직접 통합했습니다. 현재 퍼블릭 프리뷰 (public preview) 단계에 있는 이 함수들을 사용하면 Snowflake 스테이지 (stages)나 심지어 S3와 같은 외부 객체 스토리지 (external object storage)에 있는 이미지, 오디오, 문서와 같은 비정형 데이터에 대해 추론을 실행할 수 있습니다. 이는 데이터를 Snowflake의 보안 경계 (security perimeter) 밖으로 이동시키지 않고 처리됩니다.
이 시스템은 SQL이 이러한 종류의 데이터를 직접 참조하고 조작할 수 있도록 하는 네이티브 FILE 데이터 타입을 도입했습니다. 이미지를 불활성 블롭 (inert blob)으로 취급하는 대신, 쿼리 엔진 (query engine)은 이제 표준 쿼리의 일부로서 분석을 위해 모델 (model)에 이미지를 전달할 수 있습니다. 이를 통해 구조화된 데이터 (structured data)와 비정형 데이터 분석 사이의 간극을 메우기 위한 외부 도구와 전문 기술의 필요성을 제거합니다.
이것이 중요한 이유: AI/데이터 스택의 붕괴
개발자들에게 미치는 주요 결과는 데이터 스택 (data stack)의 단순화입니다. 예를 들어, 제품 카탈로그에 사용자가 업로드한 이미지를 분석하는 전형적인 워크플로우는 다음과 같은 여러 단계를 포함합니다: 데이터를 추출하기 위한 ETL 프로세스, 비전 API (vision API)를 호출하기 위한 별도의 서비스, 그리고 결과 메타데이터를 다시 웨어하우스 (warehouse)로 로드하는 또 다른 프로세스입니다. 이는 복잡성, 지연 시간 (latency), 그리고 여러 장애 지점 (points of failure)을 생성합니다.
SQL에 모델 호출을 직접 임베딩함으로써, 이러한 전체 외부 파이프라인의 필요성을 제거할 수 있습니다. 이는 몇 가지 구체적인 이점을 제공합니다. 첫째, 성능과 비용입니다. Snowflake는 이러한 네이티브 통합 (native integration)이 전통적인 수동 오케스트레이션 (manually orchestrated) AI 구현 방식과 비교했을 때 30% 이상 빠르고 비용을 최대 60%까지 절감할 수 있다고 주장합니다. 둘째, 접근의 민주화입니다. 이제 어떤 데이터 분석가라도 시각적 특성에 기반한 제품 필터링이나 통화 녹음으로부터 고객 감정 (sentiment)을 집계하는 것과 같이, 이전에는 머신러닝 엔지니어 (machine learning engineer)가 필요했던 작업들을 수행할 수 있습니다. 마지막으로, 거버넌스 (governance)를 통합합니다. 정형 데이터와 비정형 데이터 모두 단일한 보안 플랫폼 내에서 처리됩니다.
실질적인 SQL 예시
product_id 및 price와 같은 정형 데이터와 Snowflake 스테이지 (stage)에 저장된 제품 이미지 URL을 포함하는 열이 있는 제품 목록 테이블이 있다고 가정해 보겠습니다. 이미지에 필수 안전 경고 라벨이 누락된 제품을 식별해야 합니다.
외부 이미지 처리 서비스를 구축하는 대신, 이제 SQL 쿼리를 작성하여 직접 확인을 수행할 수 있습니다.
-- 기본 이미지에서 눈에 보이는 안전 라벨이 누락된 제품 찾기
SELECT
p.product_id,
...
이 쿼리는 단일 문장에서 정형 제품 데이터와 비정형 이미지 데이터에 대한 AI 기반 분석을 결합합니다. 이는 데이터 팀이 이미 사용 중인 환경 내에서 분류 (classification), 객체 탐지 (object detection), 오디오로부터의 감정 분석 (sentiment analysis) 등으로 확장할 수 있는 단순하지만 강력한 패턴입니다.
개발자를 위한 시사점
데이터 플랫폼 (data platform)과 AI 플랫폼 (AI platform) 사이의 경계가 허물어지고 있습니다. 멀티모달 추론 (multimodal inference)을 데이터 웨어하우스 (data warehouse)로 직접 가져오는 것은 AI의 프로덕션화 (productionalization)를 단순화하는 중요한 단계입니다. 엔지니어와 데이터 팀에게 이는 배관 작업 (plumbing) 및 오케스트레이션 (orchestration)에 소비되는 시간을 줄이고, 데이터로부터 가치를 추출하는 데 더 많은 시간을 할애할 수 있음을 의미합니다.
많은 조직에서 가장 가치 있는 데이터인 콜 녹음 (call recordings), 지원 문서 (support documents), 제품 이미지 (product images), 홍보 영상 (promotional videos) 등은 종종 대규모로 분석하기 가장 어려운 데이터입니다. 이러한 데이터를 네이티브하게 처리하는 장벽을 낮춰주는 도구는 매우 중요한 돌파구 (unlock)가 됩니다. 이제 복잡한 Python 기반의 데이터 처리 작업들을 재평가하고, 이를 몇 줄의 SQL로 대체할 수 있는지 살펴볼 때입니다.
Sources
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기