Wednesday, October 7, 2026
AI 인프라 · 뉴스 & 분석
홈 › 데이터센터 › 리포트
데이터센터 · 리포트

Dell added data context, preparation, and storage features to its AI data platform.

Data preparation and storage optimization are critical for model training and inference pipelines; Dell's platform tooling extends vendor infrastructure stack for AI workloads.
업계 전문지Slicast · 2026년 10월 6일 12:59 UTC · 글로벌 · 출처: The Next Platform
중요도 62

올해 초, Dell은 전 세계 3,800명의 기업 IT 의사결정자와 AI 전문가를 대상으로 AI 기술 도입 및 확장에 관한 경험을 조사했다. 조사 결과 데이터(품질, 가용성, 관리, 보안)가 기업들이 직면한 최고의 과제로 떠올랐다.

이는 Dell이 2년 전 AI Data Platform을 출시한 이후 강조해온 내용을 검증한다. 즉, AI를 확장하는 조직들은 GPU나 하드웨어가 아닌 데이터 준비 상태에 의해 제약을 받는다는 것이다.

"이는 우리가 고객들로부터 매일 듣는 문제다"라고 Dell 인프라 솔루션 그룹의 수석 부사장 Varun Chhabra가 최근 언론 브리핑에서 말했다. "인프라는 준비되어 있지만, 데이터는 준비되지 않았고, AI를 위해 준비된 데이터가 없으면 투자는 파일럿 프로젝트에서 벗어나지 못한 고립된 프로젝트로 전락하여 조직 전체에서 그 잠재력을 충분히 발휘하지 못한다. 진정한 병목은 컴퓨팅 리소스에 대한 접근이 아니다. 모델에 대한 접근도 흔히 문제가 아니다. 실제 병목은 데이터에 대한 접근이다. 기업 데이터는 AI 워크로드 확장을 지원할 준비가 된 상태가 단순히 아니다."

Chhabra는 기업 데이터가 클라우드, 데이터센터, 파일 시스템, 데이터베이스, 애플리케이션, 엣지 인프라 등 조각난 위치에 산재되어 있다고 지적했다. "대부분의 데이터가 워크로드 기반의 사일로에 갇혀 있고, 이에 접근할 통합된 방법이 종종 없다. 대부분의 데이터가 비정형이다. 흔히 다크 데이터로, 실질적으로 AI에 보이지 않는다. 또한 거버넌스가 제대로 이루어지지 않아 팀들이 AI의 접근 필요성과 제어를 요구하는 정책 사이에서 갈등을 빚게 된다."

Dell의 AI Data Platform은 AI Factory의 핵심 구성요소이며, 3개의 계층으로 이루어져 있다. Data Orchestration Engine은 통합 파이프라인을 통해 데이터 수집, 준비, 레이블링, 강화를 처리하고, 컴퓨팅과 스토리지를 분리하는 분산 제어, 그리고 Nvidia NIM 마이크로서비스, AI Blueprints, 템플릿에 대한 기본 접근을 제공한다.

분석, 처리, 검색용 Data Engines를 통해 조직은 올바른 데이터를 수주가 아닌 몇 시간 안에 찾을 수 있다. Storage Engines는 비정형 데이터와 고처리량 AI 워크로드를 위한 네트워크 연결 스토리지인 PowerScale과 대규모 객체 저장소 및 AI 모델 스냅샷을 지원하는 S3-over-RDMA 및 Nvidia CUDA 라이브러리를 지원하는 ObjectScale, 그리고 Nvidia의 GTC 2026(3월)에서 발표되고 다음 달 출시된 고속 소프트웨어 정의 병렬 시스템인 Lightning File System을 포함하며, 이는 대규모 학습 및 추론을 위해 설계되었다.

Nvidia 기술이 플랫폼의 기초를 이룬다. CUDA 라이브러리와 NIM 마이크로서비스를 넘어, 문서 파싱, 임베딩, 재순위 지정을 위한 Nvidia의 Nemotron Retriever 모델과 벡터 인덱싱 및 검색을 위한 GPU 가속 알고리즘 오픈소스 라이브러리인 cuVS가 포함된다.

통합 스토리지 계층은 GPU가 데이터 대기로 인한 시간을 피하고 Chhabra가 "파일럿 재현 격차"라고 부르는 것을 해결할 수 있는 엑사바이트 규모의 역량을 제공한다. 즉, 데모나 소규모 파일럿에서 작동하는 사용 사례가 확장될 때는 데이터 거버넌스 문제, 누락되거나 오염된 데이터, 그로 인한 AI 결과 악화로 인해 실패하곤 한다는 뜻이다. "이는 실제로 기업 규모에서 발전이 저해되는 지점이다"라고 Chhabra는 말했다.

이번 주, Dell은 에이전트 AI를 위한 새로운 기능으로 플랫폼을 확장하고 있다. 이러한 기능은 분산된 정형 및 비정형 데이터 전반에 걸쳐 에이전트에게 공통 맥락과 일관된 의미를 제공하고, 관련 맥락을 찾기 위한 더 간단한 경로, 그리고 이를 적용할 도구를 제공한다.

동일한 데이터 및 문서에 접근하는 에이전트들은 현재 각 쿼리마다 이해를 재구성하고 토큰을 재생성해야 한다고 Chhabra는 설명했다. "이는 추가 토큰을 소비하고 흔히 루프 내 인간의 불가피한 상호작용으로 인한 불필요한 반복을 야기하여 처리 속도를 늦춘다. 흔히 답변이 충분히 신뢰할 수 없다. 맥락이 중요하다. 이 모든 기능은 에이전트가 모든 요청에서 맥락을 계속 재구성할 필요가 없기 때문에 단계와 비용을 감소시킨다. 에이전트로 흘러들어오는 데이터가 컴퓨팅 비용과 토큰 생성을 감소시킨다."

Unified Semantic Layer는 단어가 어디에 나타나든 같은 의미를 갖도록 보장하는 규칙과 정의를 제공한다. 예를 들어 제조업에서 "결함"이라는 용어가 각 공장마다 다르게 정의될 수 있다. 검색 가능한 용어집을 포함하는 Unified Semantic Layer는 에이전트가 일관된 의미를 이해하도록 보장한다. Dell은 Nvidia의 Auto-Ontology 오픈소스 라이브러리를 통합하여 기업 데이터에서 지식 그래프를 생성한다.

Enterprise Knowledge Graph는 메타데이터, 계보, 쿼리 이력을 통해 정형 및 비정형 데이터가 어떻게 연관되는지 보여주며, 지속적으로 개선된다. Semantic Layer는 단어가 무엇을 의미하는지를 정의하고, Knowledge Graph는 시스템 전반에 걸쳐 데이터 간의 연결을 제공한다. "특정 공급자나 유통업체와의 결함 빈도를 상관관계 분석한다면"이라고 Chhabra는 말했다. "Enterprise Knowledge Graph는 공급망 내에서 이러한 연결을 모델에 제공할 수 있으므로, 모델이 매번 토큰을 다시 실행하고 생성해야 하는 대신 훨씬 더 토큰 효율적이다."

이 계층들 위에 구축된 Knowledge Agents는 특정 주제에 특화된 신뢰할 수 있는 에이전트로 기능한다. 기업들은 이들의 행동, 토큰 예산, 데이터 접근을 관리하는 규칙을 설정할 수 있다. 이러한 에이전트들은 또한 추론과 시각 데이터 이해를 위해 Nvidia의 Nemotron Retriever 모델을 활용한다. Knowledge Agents는 기업에 더 큰 유연성을 제공한다. 모델 크기를 선택하고, 클라우드에 범용 모델을 배포하거나, 온프레미스에서 오픈소스 모델을 실행할 수 있다.

Dell은 Data Processing Engine에 Nvidia의 cuDF GPU 가속 라이브러리를 도입하여 더 빠른 데이터 처리와 분석을 가능하게 하고, Apache Arrow를 통해 스토리지와 처리 사이의 데이터를 효율적으로 이동하여 쿼리가 데이터가 있는 위치에서 실행되도록 한다. GPU 가속은 CPU보다 배치 처리에서 20배 빠르고 전체 데이터 처리 속도에서 4배 빠를 수 있다. 이는 이미 Processing Engine에 있는 cuVS 강화 검색 및 cuDF 분석을 보완한다.

ObjectScale 및 PowerScale을 위한 새로운 오픈소스 Dell Storage Performance Tool을 통해 조직은 AI 인프라의 크기를 정확하게 파악하고 GPU로의 데이터 흐름을 유지할 수 있다. 사용자는 순차 쓰기, 높은 동시성 읽기, 혼합 읽기-쓰기 환경, 복잡한 쿼리 등 자신만의 워크로드를 정의하여 벤치마킹할 수 있으며, Dell Engineering이 내부적으로 사용하는 것과 동일한 도구를 사용한다.

원문 보기
Dell added data context, preparation, and… · Slicast