AI 스토리지⑥ — AI 스토리지 공급망: 누가 GPU에 데이터를 먹여 살리나?
AI 스토리지⑥ — AI 스토리지 공급망: 누가 GPU에 데이터를 먹여 살리나? · 불마켓 제작

AI 인프라의 마지막 병목은 ‘데이터를 어디서 얼마나 빨리 가져오느냐’다

쉽게 말하면

대형 공장이 아무리 좋은 기계를 갖춰도 원자재가 제때 도착하지 않으면 생산라인은 멈춥니다. AI에서 GPU가 생산기계라면 NAND·SSD·스토리지 네트워크·파일시스템은 원자재 창고와 물류망입니다.

AI 데이터센터에는 GPU만 있는 것이 아니다.

수 PB의 학습데이터를 저장할 NAND Flash, NVMe controller, high-speed SSD, storage server, Ethernet/InfiniBand, distributed file system, metadata engine, data governance software가 모두 필요하다.

GPU가 AI Factory의 계산기라면 스토리지 공급망은 그 계산기에 원료를 공급하는 물류망이다.

이번 시리즈 마지막 편에서는 AI Storage를 구성하는 기업과 기술을 계층별로 나눠본다.

NAND Flash — Micron·Samsung·SK hynix·Kioxia

먼저 역할부터

NAND는 SSD 안에 실제 데이터를 저장하는 ‘창고 선반’입니다. TLC는 상대적으로 성능과 내구성이 좋고, QLC는 한 셀에 더 많은 데이터를 담아 용량과 가격 효율을 높이는 방향에 강점이 있습니다.

NVMe SSD의 기본 저장매체는 NAND Flash다.

AI 데이터센터에서는 가장 빠른 TLC NAND뿐 아니라 고용량 QLC NAND의 중요성도 커지고 있다.

Hot data와 checkpoint에는 고성능 TLC SSD를 쓰고, 대규모 dataset이나 warm data에는 고용량 QLC SSD를 사용할 수 있다.

Micron은 2026년 PCIe Gen6 9650 SSD와 최대 245TB 6600 ION을 AI·클라우드 workload용으로 확대하고 있다.

Samsung, SK hynix, Kioxia도 enterprise SSD와 NAND 고집적 경쟁을 이어가고 있다.

AI 데이터량이 늘어날수록 bit density와 TB당 전력효율이 핵심 경쟁력이 된다.

AI 스토리지⑥ — AI 스토리지 공급망: 누가 GPU에 데이터를 먹여 살리나? 핵심 구조와 데이터 흐름
핵심 구조와 데이터 흐름 · 공식 자료를 바탕으로 불마켓이 재구성

SSD Controller와 Connectivity — Marvell 같은 반도체 업체

쉬운 비유

NAND가 창고 선반이라면 SSD Controller는 창고 관리자입니다. 어느 데이터가 어디에 있는지 관리하고, 오류를 고치고, 오래 쓰도록 저장 위치를 조정하며, 서버와 NVMe 규칙으로 대화합니다.

NAND만으로 SSD가 만들어지는 것은 아니다.

Controller는 NAND channel을 관리하고 error correction, wear leveling, garbage collection, PCIe/NVMe protocol을 처리한다.

Marvell은 storage controller와 data infrastructure silicon 분야에서 오랫동안 강점을 가지고 있다.

AI 스토리지가 PCIe Gen6, NVMe-oF, CXL로 확장될수록 controller와 high-speed SerDes, retimer의 중요성도 함께 높아진다.

즉 AI storage 공급망은 memory semiconductor와 connectivity semiconductor가 결합된 시장이다.

Storage Array — Pure Storage와 고성능 Flash 플랫폼

쉬운 비유

기업은 SSD 수천 개를 각자 관리하기보다 여러 창고를 하나의 물류센터처럼 운영해주는 시스템을 사용합니다. Storage Array는 많은 SSD를 묶어 장애가 나도 데이터를 지키고 여러 GPU가 동시에 사용할 수 있게 해줍니다.

기업과 클라우드는 SSD를 수천 개 직접 관리하기보다 storage platform을 사용한다.

Pure Storage의 FlashBlade 계열은 scale-out file/object storage를 제공하며 AI training과 unstructured data workload를 겨냥한다.

AI에서 중요한 것은 단순 capacity보다 여러 GPU node가 동시에 접근할 때 높은 throughput과 metadata performance를 유지하는 것이다.

스토리지 array 업체는 SSD를 묶어 redundancy와 snapshots, data protection, QoS를 제공하고 GPU cluster가 쉽게 사용할 수 있는 file/object interface를 만든다.

AI 스토리지⑥ — AI 스토리지 공급망: 누가 GPU에 데이터를 먹여 살리나? 기술 전환과 시스템 구성
기술 전환과 시스템 구성 · 공식 자료를 바탕으로 불마켓이 재구성

NetApp — AI 데이터 관리와 Metadata의 중요성

Metadata를 쉽게 말하면

도서관의 책 자체가 데이터라면, ‘어느 책이 어느 서가에 있고 누가 빌릴 수 있는지’를 적은 도서목록이 metadata입니다. AI 시대에는 데이터가 너무 많아 이 목록과 권한 관리가 매우 중요해집니다.

AI 시대에는 데이터를 빠르게 읽는 것만큼 ‘어떤 데이터가 어디에 있는지 아는 것’이 중요하다.

기업에는 수십 년 동안 쌓인 파일, 데이터베이스, 클라우드 object가 여러 위치에 흩어져 있다.

NetApp은 2026년 NVIDIA와 함께 AI Data Engine을 확대하며 글로벌 metadata catalog와 AI data governance를 강조하고 있다.

좋은 AI 모델을 만들려면 데이터를 찾고, 권한을 확인하고, 중복을 제거하고, 최신 버전을 식별해야 한다.

AI Storage가 hardware 시장에서 data management 시장으로 확장되는 이유다.

Distributed File System — DDN·WEKA 등 전문업체

쉬운 비유

한 창고 문으로 수천 명이 동시에 들어가면 막힙니다. 여러 창고와 출입문으로 데이터를 나눠놓고 동시에 읽게 만드는 것이 분산 파일시스템의 핵심입니다.

수천 GPU가 하나의 데이터셋을 동시에 읽으려면 일반 NAS 하나로는 성능이 부족할 수 있다.

HPC와 AI에서는 데이터를 여러 storage node에 stripe하고 병렬로 읽는 distributed file system을 사용한다.

DDN과 WEKA 같은 업체는 대규모 AI training cluster를 겨냥해 높은 aggregate bandwidth와 metadata scalability를 제공한다.

GPU node가 늘어날수록 storage node도 수평으로 확장해야 한다.

AI 스토리지의 핵심은 ‘SSD 한 대의 benchmark’가 아니라 클러스터 전체에서 성능을 선형에 가깝게 확장하는 능력이다.

AI 스토리지⑥ — AI 스토리지 공급망: 누가 GPU에 데이터를 먹여 살리나? 메모리·스토리지 계층 및 운영 구조
메모리·스토리지 계층 및 운영 구조 · 공식 자료를 바탕으로 불마켓이 재구성

NVIDIA는 스토리지 회사가 아닌데 왜 중요할까?

NVIDIA는 SSD를 만들지 않지만 AI Storage architecture에 큰 영향을 준다.

GPUDirect Storage는 GPU memory와 storage를 직접 연결하고, Dynamo는 KV Cache를 CPU와 SSD, remote storage로 offload한다.

AI Data Platform reference design은 storage 업체가 GPU와 networking stack에 맞춰 시스템을 최적화하도록 유도한다.

즉 NVIDIA는 storage vendor라기보다 ‘GPU가 원하는 데이터 경로’를 정의하는 플랫폼 역할을 한다.

Storage 업체가 NVIDIA ecosystem과 얼마나 잘 통합되는지가 AI 시장에서 중요한 경쟁조건이 되는 이유다.

앞으로 AI 스토리지에서 볼 기술

첫째는 PCIe Gen6 SSD adoption이다.

둘째는 NVMe 2.4와 NVMe-oF RDMA/TCP의 실제 제품 적용이다.

셋째는 CXL 4.0 memory expansion과 pooling이다.

넷째는 KV Cache offloading과 inference storage tiering이다.

다섯째는 GPUDirect Storage와 GPU-centric I/O다.

여섯째는 model distribution과 checkpoint optimization이다.

이 기술들은 서로 별개가 아니다. 모두 ‘GPU가 데이터를 기다리는 시간을 줄인다’는 하나의 목표로 연결된다.

AI 인프라 시리즈의 마지막 퍼즐

한 번에 정리하면

GPU는 계산하고, HBM은 가장 가까운 작업대, CXL은 추가 서랍, NVMe는 고속 창고, 네트워크는 물류도로입니다. 냉각은 열을 빼고 전력 인프라는 모든 장비를 켭니다. 이 관계를 이해하면 AI 데이터센터의 큰 그림이 완성됩니다.

불마켓의 AI 산업기술 시리즈는 반도체에서 시작했다.

GPU와 HBM, 첨단패키징을 살펴본 뒤 데이터센터, 네트워크·광통신, 냉각, 전력으로 확장했다.

마지막으로 스토리지와 메모리 계층을 살펴보면 AI Factory의 전체 그림이 완성된다.

계산은 GPU가 하고, HBM이 가장 가까운 데이터를 공급하며, 네트워크가 GPU를 연결하고, 스토리지가 대규모 데이터를 공급한다. 냉각은 열을 빼내고 전력 인프라는 모든 장비를 켠다.

이제 다음 산업기술 시리즈부터는 AI 데이터센터 내부를 벗어나 휴머노이드, 로봇, 양자컴퓨팅, 우주·위성, 사이버보안 같은 새로운 산업으로 확장할 수 있다.

이 글에서 기억할 핵심

AI 스토리지 공급망을 읽는 기준

AI 스토리지 공급망은 NAND와 SSD만으로 끝나지 않습니다. 컨트롤러, 네트워크, 파일시스템, 데이터 관리 소프트웨어까지 연결해야 GPU가 기다리지 않으므로 각 기업이 어느 병목을 해결하는지 구분해 봐야 합니다.

  • AI 스토리지와 메모리 인프라는 GPU가 데이터를 기다리지 않게 만드는 핵심 시스템이다.
  • AI 스토리지 공급망의 경쟁력은 더 많은 데이터를 저장하는 데 있지 않고, GPU가 필요한 데이터를 정확한 순간에 가장 빠른 계층에서 꺼내 쓸 수 있게 만드는 데 있다.
  • 최신 규격과 기술은 상용화 수준과 연구·로드맵 단계를 구분해 설명해야 한다.

한 줄 핵심

AI 스토리지 공급망의 경쟁력은 더 많은 데이터를 저장하는 데 있지 않고, GPU가 필요한 데이터를 정확한 순간에 가장 빠른 계층에서 꺼내 쓸 수 있게 만드는 데 있다.

같이 읽기

공식·주요 참고자료

※ 본 글은 산업과 기술 구조를 이해하기 위한 정보형 콘텐츠이며 특정 종목의 매수·매도 추천이나 수익 보장을 목적으로 하지 않습니다.