AI 스토리지① — AI는 왜 저장장치까지 빨라야 할까?
AI 스토리지① — AI는 왜 저장장치까지 빨라야 할까? · 불마켓 제작

GPU가 아무리 빨라도 데이터가 늦게 오면 기다린다

쉽게 말하면

최고급 요리사가 있어도 재료가 주방에 늦게 도착하면 요리는 빨리 나올 수 없습니다. AI에서 GPU가 요리사라면 스토리지는 재료창고이자 물류센터입니다. 이 글은 ‘저장장치가 왜 GPU 성능과 연결되는가’를 이해하는 데 초점을 둡니다.

AI 데이터센터를 이야기하면 GPU, HBM, 네트워크가 먼저 떠오른다. 그런데 실제 AI 시스템에서는 한 가지 질문을 더 해야 한다. ‘GPU가 계산할 데이터를 어디에서 가져오는가?’다.

거대한 언어모델은 수백 GB에서 수 TB에 이르는 모델 파일을 사용하고, 학습 데이터셋은 PB 단위까지 커진다. 학습 중에는 수많은 GPU가 데이터를 반복해서 읽고, 일정한 간격으로 체크포인트를 저장한다. 추론 단계에서는 모델을 빠르게 불러오고, 수많은 사용자의 요청에 따라 KV Cache와 임시 데이터를 관리해야 한다.

이 과정에서 스토리지가 느리면 GPU는 계산을 하지 못하고 기다린다. 수억원짜리 GPU가 저장장치 때문에 놀게 되는 셈이다.

그래서 AI 시대의 스토리지는 단순한 ‘파일 보관함’이 아니다. GPU에 데이터를 공급하고, 학습 상태를 저장하고, 추론 캐시를 관리하며, 장애가 났을 때 수천 개 GPU가 다시 작업을 시작하게 해주는 실시간 데이터 인프라로 바뀌고 있다.

AI 학습은 데이터를 한 번 읽고 끝나지 않는다

먼저 이렇게 생각해보세요

AI 학습은 책을 한 번 읽고 끝내는 공부가 아닙니다. 같은 자료를 여러 번 꺼내 보고, 여러 GPU가 동시에 다른 페이지를 읽습니다. 그래서 저장장치 하나의 최고속도보다 ‘많은 GPU가 동시에 읽을 때도 막히지 않는가’가 더 중요합니다.

대규모 AI 모델을 학습할 때는 이미지, 텍스트, 음성, 영상 등 방대한 데이터를 여러 번 반복해서 읽는다. 데이터는 여러 GPU 노드로 분산되고 각 GPU는 자신에게 필요한 데이터를 끊임없이 가져온다.

하나의 SSD가 빨라도 수천 개 GPU가 동시에 접근하면 전체 저장시스템의 처리량이 부족할 수 있다. 따라서 AI 스토리지는 개별 드라이브 속도보다 ‘전체 클러스터가 동시에 얼마나 많은 데이터를 읽을 수 있는가’가 더 중요하다.

스토리지 시스템은 데이터를 여러 장치에 분산하고 병렬로 읽게 하며, GPU가 필요로 하는 순서에 맞춰 데이터를 공급해야 한다. 파일시스템과 네트워크, SSD가 하나의 파이프라인처럼 움직여야 한다.

이 때문에 AI 스토리지에서는 GB/s보다 TB/s 수준의 aggregate throughput이 중요해지고 있다.

AI 스토리지① — AI는 왜 저장장치까지 빨라야 할까? 핵심 구조와 데이터 흐름
핵심 구조와 데이터 흐름 · 공식 자료를 바탕으로 불마켓이 재구성

체크포인트는 왜 AI 스토리지에서 그렇게 중요할까?

쉬운 비유

게임을 오래 하다가 중간 저장을 하지 않았는데 전원이 꺼지면 처음부터 다시 해야 합니다. AI 학습의 체크포인트는 바로 이 ‘중간 저장’입니다. 모델이 클수록 저장해야 할 파일도 거대해져 스토리지 속도가 학습시간에 직접 영향을 줍니다.

AI 모델 학습은 며칠에서 몇 주 동안 이어질 수 있다. 이때 GPU 한 대가 고장 나거나 전력 문제가 발생했다고 처음부터 다시 학습할 수는 없다.

그래서 일정한 간격으로 모델 파라미터, 옵티마이저 상태, 학습 진행상태를 저장한다. 이것이 checkpoint다.

최신 대형 모델에서는 하나의 체크포인트가 수백 GB에서 수 TB까지 커질 수 있다. 수천 GPU가 동시에 체크포인트를 저장하면 순간적으로 엄청난 쓰기 트래픽이 발생한다.

저장이 너무 오래 걸리면 그 시간 동안 GPU 학습이 중단될 수 있다. 따라서 checkpoint write speed는 곧 GPU utilization과 연결된다.

2026년 NVIDIA도 대형 모델 체크포인트의 전송·압축 비용을 줄이는 기술을 계속 확대하고 있다. AI 스토리지가 ‘백업’이 아니라 계산 성능의 일부가 된 이유다.

모델을 불러오는 시간도 점점 중요해진다

AI 서비스에서는 같은 모델을 항상 한 서버에서만 실행하지 않는다.

수요가 늘면 새로운 GPU 노드를 추가하고, 다른 지역으로 서비스를 확장하고, 새로운 버전의 모델을 배포한다. 이때 수백 GB의 모델 파일을 여러 서버에 빠르게 복사해야 한다.

모델이 500GB인데 스토리지에서 읽어오는 데 수십 분이 걸린다면 새 GPU를 확보해도 바로 서비스에 투입할 수 없다.

그래서 AI 인프라에서는 ‘model loading time’과 ‘model distribution’도 중요한 성능지표가 된다. NVIDIA는 2026년 ModelExpress 같은 기술을 통해 대형 모델 아티팩트를 빠르게 배포하는 문제를 별도의 인프라 영역으로 다루고 있다.

AI 스토리지① — AI는 왜 저장장치까지 빨라야 할까? 기술 전환과 시스템 구성
기술 전환과 시스템 구성 · 공식 자료를 바탕으로 불마켓이 재구성

HDD는 끝났을까? 그렇지는 않다

쉽게 말하면

모든 물건을 집 앞 서랍에 보관할 필요는 없습니다. 자주 쓰는 물건은 손 닿는 곳에, 잘 안 쓰는 물건은 창고에 두는 것처럼 AI 데이터도 속도와 가격에 따라 여러 저장계층에 나눠 둡니다.

AI 데이터가 많다고 모든 데이터를 초고속 SSD에 저장할 수는 없다. 비용이 너무 크기 때문이다.

자주 사용하는 학습데이터와 체크포인트는 NVMe SSD에 두고, 오래된 데이터셋이나 원본 영상은 고용량 HDD 또는 object storage에 저장할 수 있다.

즉 AI 데이터센터도 계층형 storage hierarchy를 사용한다.

가장 빠른 HBM과 GPU 메모리 → CPU DRAM → CXL 확장메모리 → NVMe SSD → network storage → object storage → archive가 속도와 가격에 따라 계층을 이룬다.

중요한 것은 모든 데이터를 가장 빠른 장치에 두는 것이 아니라 ‘지금 필요한 데이터를 가장 빠른 계층에 올려두는 것’이다.

AI 추론 시대에는 저장장치의 역할이 또 달라진다

학습에서는 거대한 데이터셋과 체크포인트가 중요하지만 추론에서는 다른 종류의 데이터 이동이 발생한다.

수많은 사용자의 대화 상태, 프롬프트 prefix, KV Cache, vector database, RAG 문서, embedding 데이터가 지속적으로 읽고 쓰인다.

특히 장문 context와 agentic AI가 확대되면 GPU 메모리에 모든 KV Cache를 보관하기 어려워진다. 일부 캐시를 CPU 메모리나 SSD, 네트워크 스토리지로 내리는 계층형 캐싱이 중요해진다.

그래서 AI 스토리지는 학습용 ‘고속 파일시스템’에서 추론용 ‘활성 메모리 계층’으로까지 역할이 확대되고 있다.

AI 스토리지① — AI는 왜 저장장치까지 빨라야 할까? 메모리·스토리지 계층 및 운영 구조
메모리·스토리지 계층 및 운영 구조 · 공식 자료를 바탕으로 불마켓이 재구성

스토리지 네트워크도 함께 빨라져야 한다

쉬운 비유

창고 문은 넓은데 창고에서 공장까지 가는 도로가 한 차선이면 결국 막힙니다. NVMe SSD가 빨라도 스토리지 네트워크가 느리면 GPU는 데이터를 기다립니다. 그래서 저장장치와 네트워크를 함께 봐야 합니다.

NVMe SSD가 아무리 빨라도 GPU 서버와 스토리지 사이 네트워크가 느리면 병목은 그대로다.

AI 데이터센터는 100G, 200G, 400G Ethernet이나 InfiniBand를 사용해 스토리지를 연결한다. NVMe-oF를 사용하면 네트워크를 통해 원격 NVMe 장치를 로컬에 가까운 지연시간으로 사용할 수 있다.

또 NVIDIA GPUDirect Storage는 CPU 메모리를 거치는 불필요한 복사를 줄이고 저장장치에서 GPU 메모리까지 더 직접적인 데이터 경로를 만든다.

즉 AI 스토리지는 SSD 하나의 문제가 아니라 NVMe + 네트워크 + GPU DMA + 파일시스템이 함께 만드는 end-to-end 데이터 경로 문제다.

AI 스토리지의 핵심 지표는 무엇일까?

첫째는 sequential throughput이다. 대형 데이터셋과 모델 파일을 얼마나 빠르게 읽고 쓸 수 있는지 본다.

둘째는 IOPS다. 작은 파일과 많은 동시 요청을 얼마나 처리하는지 중요하다.

셋째는 latency다. 특히 inference cache와 metadata access에서는 낮은 지연시간이 필요하다.

넷째는 checkpoint completion time이다. 대규모 GPU 클러스터가 얼마나 빨리 상태를 저장하고 다시 학습으로 돌아갈 수 있는지를 본다.

다섯째는 capacity와 power efficiency다. AI 데이터가 PB 단위로 늘어나면 TB당 가격과 전력소비도 매우 중요하다.

이 다섯 가지를 함께 봐야 ‘빠른 SSD’와 ‘좋은 AI 스토리지 시스템’을 구분할 수 있다.

이번 시리즈의 전체 지도

이번 AI 스토리지·메모리 인프라 시리즈는 가장 기본적인 데이터 흐름에서 시작해 NVMe·NVMe-oF, CXL memory pooling, KV Cache, GPUDirect Storage, 그리고 공급망까지 이어진다.

AI 반도체가 계산을 담당하고 네트워크가 GPU끼리 연결한다면 스토리지는 그 시스템에 데이터를 지속적으로 공급한다.

이 시리즈를 끝까지 보면 AI Factory가 단순히 GPU를 많이 모은 시설이 아니라 ‘계산·메모리·네트워크·스토리지’가 하나의 데이터 이동 시스템으로 동작하는 구조라는 점을 이해할 수 있다.

이 글에서 기억할 핵심

AI 스토리지의 역할

이 글에서는 저장장치를 단순한 보관소가 아니라 GPU에 데이터를 공급하는 경로로 봅니다. 핵심은 용어 암기보다 데이터가 저장장치에서 메모리와 GPU까지 이동하면서 어디에서 기다림이 생기는지 이해하는 것입니다.

  • AI 스토리지와 메모리 인프라는 GPU가 데이터를 기다리지 않게 만드는 핵심 시스템이다.
  • AI 스토리지는 데이터를 보관하는 창고가 아니라 GPU가 쉬지 않고 계산하도록 데이터를 공급하는 ‘AI Factory의 물류 시스템’이다.
  • 최신 규격과 기술은 상용화 수준과 연구·로드맵 단계를 구분해 설명해야 한다.

한 줄 핵심

AI 스토리지는 데이터를 보관하는 창고가 아니라 GPU가 쉬지 않고 계산하도록 데이터를 공급하는 ‘AI Factory의 물류 시스템’이다.

같이 읽기

저장장치 성능은 하나의 숫자가 아니다

AI 시스템의 저장장치를 평가할 때 순차 읽기 대역폭만 보면 실제 병목을 놓칠 수 있습니다. 학습 데이터는 큰 파일을 연속으로 읽기도 하지만, 수많은 작은 파일을 무작위로 조회하거나 여러 GPU가 동시에 같은 저장소에 접근하기도 합니다. 이때는 용량과 GB/s뿐 아니라 IOPS, 지연시간, 메타데이터 처리량, 동시접속 성능을 함께 봐야 합니다.

운영 단계에서는 체크포인트도 중요합니다. 예를 들어 10TB의 체크포인트를 실효 20GB/s로 기록하면 이상적인 전송시간만 약 500초, 즉 8분 20초입니다. 파일시스템과 네트워크 경합, 복제 비용이 더해지면 실제 시간은 길어집니다. 저장 속도가 느리면 체크포인트 간격을 늘리게 되고, 장애가 났을 때 잃는 학습 시간도 커질 수 있습니다.

구축 전 확인할 지표

  • 데이터셋의 평균 파일 크기와 작은 파일 비율
  • 동시에 읽고 쓰는 GPU·노드 수
  • 체크포인트 크기와 목표 저장·복구 시간
  • 캐시 적중률과 원본 저장소로 되돌아가는 비율
  • 장애 시 처리량 저하와 데이터 보호 방식

편집부 계산: 10TB ÷ 20GB/s = 약 500초. 단위를 단순화한 개념 예시이며 실제 성능은 구성에 따라 달라집니다.

추가 원자료: NVIDIA GPUDirect Storage Design Guide

공식·주요 참고자료

※ 본 글은 산업과 기술 구조를 이해하기 위한 정보형 콘텐츠이며 특정 종목의 매수·매도 추천이나 수익 보장을 목적으로 하지 않습니다.