Dell, AI 데이터 플랫폼에 데이터 컨텍스트, 준비 및 스토리지 기능 추가
요약
Dell은 AI 데이터 플랫폼을 통해 기업의 데이터 문제를 해결하고 있습니다. 설문조사 결과에 따르면, AI 도입의 가장 큰 병목 현상은 GPU나 컴퓨팅 접근성이 아닌 '데이터 자체'입니다. Dell은 이 플랫폼으로 데이터 수집, 준비, 레이블링부터 스토리지까지 통합 기능을 제공합니다.
핵심 포인트
- AI 확장성의 핵심 병목은 하드웨어가 아닌 데이터 접근성이다.
- 기업 데이터는 사일로화되어 있고 비정형적이며 거버넌스 문제가 있다.
- Dell AI 플랫폼은 데이터 오케스트레이션, 분석 엔진, 통합 스토리지를 제공한다.
- 데이터 준비 및 관리가 AI 워크로드의 성공적인 확장에 필수적이다.

Dell, AI 데이터 플랫폼에 데이터 컨텍스트, 준비 및 스토리지 기능 추가
올해 초, Dell은 전 세계의 3,800개 기업 IT 의사 결정권자 및 AI 전문가들을 대상으로 한 설문조사 결과를 발표했습니다. 이 설문조사는 참가자들이 기술을 채택하고 확장하는 경험, 사용 방식, 그리고 마련한 가속화 방안에 대해 다루었습니다. 공급업체들은 데이터(품질, 가용성, 관리, 보안 포함)가 가장 큰 도전 과제라고 말했습니다.
이는 Dell 경영진에게 놀라운 일이 아니었습니다. 지난 2년 동안 AI 데이터 플랫폼을 출시한 이래로 그들은 조직이 운영에 AI를 도입하는 것을 방해하는 것이 GPU나 유사 하드웨어 상황이라기보다는 데이터 자체라는 메시지를 지속적으로 전달해 왔습니다.
Dell 인프라 솔루션 그룹의 선임 부사장인 Varun Chhabra는 최근 미디어 브리핑에서 기자들에게 “이것이 우리가 매일 고객들로부터 듣는 격차입니다. 인프라는 준비되었지만 데이터가 준비되지 않았고, AI에 적합한 데이터 없이는 투자가 고립된 파일럿으로 끝나며 조직의 나머지 부분까지 확장되는 전체 잠재력에 도달하지 못하는 고립된 파일럿이 됩니다. 실제 병목 현상은 컴퓨팅 접근성이 아니라 종종 모델 접근성입니다. 사실은 데이터 접근성입니다. 기업 데이터는 AI 워크로드를 확장하는 것을 지원할 준비가 되어 있는 곳에 있지 않습니다.”라고 말했습니다.

Chhabra는 AI가 확장하려면 많은 양의 데이터를 필요로 하지만, 그 데이터 중 상당 부분은 클라우드와 데이터센터부터 파일 시스템, 데이터베이스, 애플리케이션, 엣지 위치까지 다양한 곳에 보관되어 있다고 말했습니다. 그는 또한 “그중 상당 부분은 워크로드 기반의 사일로에 갇혀 있으며, 접근할 수 있는 통일된 방법이 종종 없습니다. 많은 부분이 비정형적입니다. 자주 어둡다는(dark) 의미인데, 이는 AI에게 실질적으로 보이지 않는다는 뜻입니다. 또한 종종 거버넌스가 되지 않아 팀들은 접근이 필요한 AI와 통제가 요구되는 정책 사이에서 갇히게 됩니다.”라고 덧붙였습니다.
Dell의 AI 팩토리(AI Factory)의 핵심 요소인 AI 데이터 플랫폼을 통해, 회사는 수많은 데이터 문제를 해결하기 위한 도구와 역량을 구축하고 있습니다. 아래에서 볼 수 있듯이, 이 플랫폼은 본질적으로 세 가지 계층으로 구성되어 있으며, 첫 번째는 데이터를 수집하고, 준비하며, 레이블링하고, 풍부하게 만드는 데이터 오케스트레이션 엔진(Data Orchestration Engine)입니다. 여기에는 통합 데이터 파이프라인, 컴퓨팅과 스토리지를 분리하는 분산 제어 기능, 그리고 Nvidia NIM 마이크로서비스, AI 블루프린트 및 템플릿에 대한 네이티브 액세스가 포함됩니다.

Chhabra는 분석, 처리 및 검색을 위한 데이터 엔진(Data Engines)이 조직들이 필요한 데이터를 몇 주가 아닌 몇 시간 만에 찾도록 돕는다고 말했습니다. 다음으로는 비정형 데이터와 고처리량 AI 워크로드를 위한 네트워크 연결 스토리지(NAS)인 PowerScale과 대규모 객체 리포지토리 및 AI 모델의 주기적 스냅샷을 지원하는 S3-over-RDMA 및 Nvidia CUDA 라이브러리를 포함하는 ObjectScale, 그리고 지난 3월 Nvidia GTC 2026 쇼에서 발표되고 한 달 뒤에 출시된 빠르고 소프트웨어 정의된 병렬 시스템인 Lightning File System이 있습니다. 이는 대규모 학습(training) 및 추론(inferencing)을 목표로 합니다.
이 플랫폼은 Nvidia 기술의 지원을 받습니다. CUDA 라이브러리와 NIM 마이크로서비스와 함께, GPU 기반 플랫폼에는 문서 구문 분석(parsing), 임베딩(embedding), 재순위 지정(reranking)을 위한 Nvidia Nemotron Retriever 모델과 벡터 인덱싱 및 검색을 위한 GPU 가속 알고리즘의 오픈 소스 라이브러리인 cuVS가 포함됩니다.
목표는 이러한 통합 스토리지 계층이 엑사바이트 규모의 기능을 제공하여, GPU가 데이터 도착을 기다리는 상황을 방지하고 Chhabra가 '파일럿 재현 격차(pilot reproduction gap)'라고 부르는 문제를 해결하는 것입니다.
“데모에서 사용 사례가 작동하거나, 작은 파일럿 배포를 거치고 사용자들과 리더십이 흥분합니다,”라고 그는 말했습니다. “하지만 규모를 확장하기 시작하면, 데이터 거버넌스(data governance)와 관련된 문제들 – 적절한 데이터를 갖지 못했거나, 오염된 데이터가 있는 경우 – 이 AI 과제나 AI 결과에 영향을 미치면서 발생합니다. 이것이 바로 실제 기업 규모 확장을 저해하는 부분입니다.”
Dell은 이번 주 플랫폼에 에이전트 기반 AI(agentic AI)에 중점을 둔 기능을 추가하고 있습니다. 새로운 기능들은 에이전트들이 구조화된 데이터와 비구조화된 데이터 전반에 걸쳐 흩어져 있는 용어들에 공통의 컨텍스트와 의미를 갖도록 설계되었으며, 이러한 데이터를 위한 적절한 컨텍스트를 찾는 과정을 더 쉽게 만들고, 나아가 그 컨텍스트를 활용할 수 있는 방법을 제공합니다.
문제는 에이전트들이 플랫폼에서 동일한 데이터, 문서 및 이력에 접근하더라도, 쿼리가 실행되고 더 많은 데이터가 분석될 때마다 이해도를 재구성하고 토큰을 재생성해야 한다는 것입니다. Chhabra가 말했습니다.

“이것은 추가적인 토큰 비용을 발생시킵니다,”라고 그는 말했습니다. “종종 인간의 개입(human in the loop)으로 인해 필연적으로 주고받는 과정이 생기면서 일부 혼란(churn)을 야기하고, 이는 속도를 늦춥니다. 종종 그렇다는 것은 여기서 얻는 답변들이 완전히 신뢰할 수 없다는 것을 의미하므로, 컨텍스트가 정말 중요합니다. [새로운 기능들이 하는 일]은 에이전트가 모든 요청에서 컨텍스트를 계속 재구축할 필요가 없어 단계 수를 줄이고 비용을 낮추는 것입니다. 실제로 데이터가 에이전트로 흘러 들어가 컴퓨팅 비용과 생성되는 토큰의 수를 줄일 수 있게 해줍니다.”
통합 시맨틱 레이어(Unified Semantic Layer)는 단어가 나타나는 모든 곳에서 동일한 의미를 갖도록 규칙과 정의를 제공합니다. Chhabra가 설명한 사용 사례에서 그는 'defect'라는 단어가 한 제조 공장에서는 하나의 정의를 갖고, 다른 공장에서는 또 다른 정의를 가질 수 있다고 언급했습니다. 검색 가능한 용어집을 포함하는 통합 시맨틱 레이어는 에이전트들이 각 공장에서 이 단어가 동일한 의미임을 이해할 수 있게 해줍니다. Dell은 또한 엔터프라이즈 데이터로부터 지식 그래프(knowledge graph)를 생성할 수 있는 Nvidia의 Auto-Ontology 오픈 소스 라이브러리를 사용하고 있습니다.
엔터프라이즈 지식 그래프는 메타데이터, 계보(lineage), 쿼리 기록을 사용하여 구조화된 데이터와 비구조화된 데이터가 어떻게 관련되어 있는지 보여주며 지속적으로 그래프를 조정합니다. 시맨틱 레이어가 에이전트에게 단어의 실제 의미를 보여줄 수 있다면, 지식 그래프는 그 데이터를 다른 시스템의 데이터와 연결할 수 있는 관계를 제공합니다.
그는 “만약 결함이 얼마나 자주 발생하는지, 그리고 그것이 특정 공급업체나 특정 유통업체 또는 공급망 내의 어떤 것과 관련되어 있는지 사이의 상관관계를 도출하려고 할 때, 모델이 매번 재실행하고 토큰을 생성해야 하는 대신에, 엔터프라이즈 지식 그래프가 실제로 그 연결고리를 모델을 위해 만들어 줄 수 있어서 훨씬 더 토큰 효율적입니다”라고 말했습니다.
사용자들은 그런 다음 시맨틱 레이어와 지식 그래프를 활용하여 특정 주제에 대한 신뢰할 수 있는 에이전트 역할을 하는 '지식 에이전트(Knowledge Agents)'를 만들 수 있습니다. 이들 주위에는 어떤 지침을 따를지, 토큰을 얼마나 사용할 수 있는지, 그리고 어떤 데이터를 볼 수 있는지 규정하는 규칙들이 구축될 수 있습니다. 또한 추론 및 데이터의 시각적 이해를 위해 Nvidia의 Nemotron Retriever 모델도 사용합니다.
Chhabra는 지식 에이전트가 기업들에게 AI 환경에서 더 큰 유연성을 제공한다고 말했습니다. 예를 들어, 특정 사용 사례에 사용하는 AI 모델의 크기를 선택하거나, 클라우드에서 범용 모델을 사용할지 아니면 온프레미스(on-premises)에서 오픈 소스 모델을 사용할지를 결정하는 것 등이 가능합니다.
Dell은 또한 데이터 처리 및 분석을 가속화하기 위해 Nvidia의 cuDF GPU 가속 라이브러리를 Data Processing Engine에 도입하고, 데이터를 저장소와 처리 엔진 사이에서 효율적으로 이동시키기 위해 Apache Arrow를 추가하여 데이터가 위치한 곳에서 쿼리될 수 있도록 합니다. 이제 조직은 데이터 처리에 CPU 대신 GPU를 사용할 수 있으며, 이는 CPU로 수행할 때보다 20배 빠른 배치(batch) 데이터 처리 및 네 배의 데이터 처리 속도를 의미합니다.

cuDF와 Arrow의 조합은 이미 Dell Processing Engine에 포함된 cuVS가 증강된 검색 기능과 cuDF 분석 기능을 보완합니다.
새로운 오픈 소스 Dell Storage Performance Tool for ObjectScale 및 PowerScale을 통해 조직은 AI 인프라에 필요한 크기를 더 정확하게 측정하고 데이터를 GPU로 계속 흐르게 할 수 있습니다.
Chhabra는 “조직은 자체 스토리지 플랫폼과 벤치마킹하려는 워크로드를 정의할 수 있으며, 체크포인트 스타일 쓰기(checkpoints style writes), 높은 동시성 읽기(high-concurrency reads), 혼합 읽기/쓰기 환경, 심지어 고점수 쿼리까지도 가능합니다.”라고 말했습니다. “그들은 Dell Engineering이 내부적으로 제품을 벤치마킹하는 데 사용하는 것과 동일한 도구를 사용하여 이러한 모든 벤치마크를 자체 인프라에서 실행할 수 있습니다.”
AI 자동 생성 콘텐츠
본 콘텐츠는 The Next Platform의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기