
AI 데이터센터에서 네트워크는 서버를 연결하는 부속품이 아닙니다. 수천 개의 GPU가 계산 결과를 동시에 교환할 때 네트워크가 늦어지면 가장 비싼 GPU도 기다리게 됩니다. AI 시대에는 네트워크 자체가 연산 성능의 일부가 됩니다.
GPU는 왜 서로 기다릴까?
대규모 AI 학습은 모델과 데이터를 여러 GPU에 나누고 계산 결과를 반복해서 합칩니다. 한 GPU의 전송이 늦으면 다른 GPU도 다음 계산을 시작하지 못합니다. 일반 웹 트래픽처럼 요청이 제각각 발생하는 것이 아니라 많은 장비가 같은 순간에 큰 데이터를 보내는 동기식 트래픽이라는 점이 다릅니다.
대역폭만 높으면 해결될까?
대역폭은 한 번에 옮길 수 있는 데이터의 양이고 지연시간은 데이터가 목적지에 도착하기까지 걸리는 시간입니다. AI 패브릭은 둘 다 중요합니다. 링크 속도가 빨라도 스위치의 큐가 밀리고 경로가 한곳에 몰리면 tail latency가 커져 전체 학습 시간이 늘어납니다.
혼잡과 RDMA가 중요한 이유
RDMA는 CPU의 개입을 줄이고 메모리 사이에 데이터를 직접 옮겨 지연시간과 처리 부담을 낮춥니다. InfiniBand는 오래전부터 고성능 컴퓨팅에 최적화돼 왔고, Ethernet도 RoCE·적응형 라우팅·정교한 혼잡 제어를 더하며 AI용 패브릭으로 진화하고 있습니다.
경쟁 범위는 어디까지일까?
AI 네트워크 경쟁은 스위치 칩 하나로 끝나지 않습니다. NIC·SuperNIC, 광모듈, 케이블, 네트워크 운영체제, 텔레메트리와 혼잡 제어 소프트웨어가 함께 검증돼야 안정적인 성능을 냅니다. NVIDIA Spectrum-X가 스위치와 SuperNIC을 함께 최적화하는 이유도 여기에 있습니다.
AI 트래픽은 일반 인터넷 트래픽과 무엇이 다를까?
일반적인 웹서비스에서는 사용자의 요청이 서로 다른 시간에 발생하고, 작은 데이터와 큰 데이터가 섞여 이동합니다. 일부 요청이 조금 늦어져도 서비스 전체가 멈추지는 않습니다. 반면 분산 학습에서는 수백·수천 개 GPU가 비슷한 시점에 통신을 시작하는 경우가 많습니다. 각 GPU가 계산한 기울기 값을 모으는 All-Reduce 같은 집단 통신에서는 가장 늦은 연결이 한 번의 학습 단계를 끝내는 시간을 결정할 수 있습니다.
이때 여러 송신자가 한 목적지나 동일한 스위치 경로로 동시에 데이터를 보내는 incast가 발생하면 버퍼가 빠르게 차오릅니다. 패킷이 손실돼 재전송하거나 큐에서 오래 기다리면 평균 지연시간보다 훨씬 긴 꼬리 지연이 생깁니다. AI 네트워크가 단순한 최고 속도보다 ‘모든 GPU에 예측 가능한 속도를 제공하는가’를 중요하게 보는 이유입니다.
Spine–Leaf 구조는 어떻게 확장될까?
대규모 AI 클러스터는 보통 서버가 연결되는 Leaf 스위치와 여러 Leaf를 연결하는 Spine 스위치로 패브릭을 구성합니다. 두 계층 사이에 충분한 링크를 배치하면 서버 사이의 경로를 여러 개 확보할 수 있고, 장애나 혼잡이 생겼을 때 다른 경로로 분산할 수 있습니다. 네트워크 단계를 줄이면 지연시간과 관리 복잡성도 낮아집니다.
하지만 포트 합계만 크다고 실제 성능이 보장되지는 않습니다. 서버에서 올라오는 총 대역폭보다 Spine 방향 용량이 작으면 oversubscription이 발생합니다. AI 학습망은 높은 동시 통신 때문에 일반 업무망보다 낮은 oversubscription 비율이나 사실상 비차단에 가까운 구성을 요구할 수 있습니다. 스위치의 radix가 높아질수록 적은 단계로 더 많은 GPU를 연결할 수 있다는 점도 중요합니다.
운영자는 어떤 지표를 확인해야 할까?
첫째는 링크의 명목 속도가 아니라 실제 유효 대역폭입니다. 둘째는 평균 지연시간과 함께 상위 99% 구간의 tail latency를 봐야 합니다. 셋째는 패킷 손실, 재전송, ECN 표시와 큐 점유율을 확인해야 합니다. 넷째는 특정 흐름이나 고객이 전체 패브릭을 방해하지 않도록 성능 격리가 작동하는지 살펴봐야 합니다.
AI 네트워크는 장비를 설치한 뒤 끝나는 설비가 아닙니다. 학습 모델, GPU 수와 통신 패턴이 달라질 때 경로 사용률도 달라지므로 텔레메트리와 시뮬레이션, 자동화된 장애 대응이 필요합니다. 결국 경쟁력은 스위치 칩의 속도와 NIC, 케이블, 광모듈, 운영 소프트웨어를 하나의 시스템으로 검증하는 능력에서 나옵니다.
InfiniBand와 Ethernet은 어떻게 선택할까?
InfiniBand는 HPC와 대규모 학습 환경에서 낮은 지연과 RDMA, 정교한 혼잡 제어를 오랫동안 발전시켜 왔습니다. Ethernet은 표준 생태계와 공급업체 선택 폭, 기존 데이터센터 운영 경험이 강점이며 RoCE와 AI 전용 기능을 더해 성능 격차를 좁히고 있습니다. 어느 하나가 항상 우월하다기보다 클러스터 규모, 기존 장비, 운영 인력과 애플리케이션 특성에 따라 선택이 달라집니다.
비교할 때는 장비 단가만이 아니라 학습 완료시간, 장애 복구, 관리도구, 광링크와 케이블 비용을 포함한 총소유비용을 봐야 합니다. 특히 여러 고객이 공유하는 클라우드에서는 한 작업의 트래픽이 다른 작업을 방해하지 않는 성능 격리가 중요합니다. 전용 연구 클러스터와 다중 테넌트 클라우드가 서로 다른 네트워크 구성을 선택할 수 있는 이유입니다.
결국 AI 네트워크의 성능은 최고 속도 표기가 아니라 GPU가 실제 계산에 사용되는 비율로 평가해야 합니다. 네트워크 대기시간이 줄어 같은 장비로 더 많은 학습 단계를 처리한다면 그 개선이 곧 컴퓨팅 효율입니다.
핵심 정리
- 대역폭은 AI 네트워크의 성능과 확장성을 판단하는 핵심 요소입니다.
- 낮은 지연은 AI 네트워크의 성능과 확장성을 판단하는 핵심 요소입니다.
- 혼잡 제어은 AI 네트워크의 성능과 확장성을 판단하는 핵심 요소입니다.
- 성능 격리은 AI 네트워크의 성능과 확장성을 판단하는 핵심 요소입니다.
다음 글: AI 네트워크② — 광트랜시버: 서버 사이의 전기신호를 왜 빛으로 바꿀까?
같은 고속 네트워크라도 역할은 다르다
AI 인프라를 볼 때는 먼저 scale-up과 scale-out을 나눠야 합니다. Scale-up은 한 시스템 안에서 가속기들이 매우 짧은 지연시간으로 데이터를 주고받는 영역이고, scale-out은 여러 서버와 랙을 묶어 하나의 학습 클러스터처럼 작동시키는 영역입니다. 인터넷 서비스의 일반적인 남북 방향 트래픽보다, AI 학습에서는 서버 사이를 오가는 동서 방향 트래픽과 집단통신의 비중이 훨씬 큽니다.
따라서 포트 속도만 높다고 학습이 빨라지는 것은 아닙니다. All-reduce 같은 동기식 작업은 느린 경로나 혼잡한 링크 하나 때문에 전체 단계가 기다릴 수 있습니다. 실제 설계에서는 대역폭과 지연시간뿐 아니라 무손실 전송, 혼잡 제어, 토폴로지, 경로 다중화, 패킷 손실과 재전송, 텔레메트리를 함께 확인해야 합니다.
독자가 확인할 다섯 가지
- 해당 연결이 scale-up인지 scale-out인지
- 표기 속도가 포트 속도인지 시스템 실효 처리량인지
- 혼잡 제어와 부하 분산이 학습 트래픽에 맞춰져 있는지
- 스위치·NIC·케이블이 하나의 구조로 검증됐는지
- 장애와 지연을 추적할 관측 도구가 준비됐는지
추가 원자료: NVIDIA Enterprise Reference Architecture — Key Building Blocks, NVIDIA Spectrum-X Documentation
참고자료
※ 본 글은 산업 기술을 설명하기 위한 정보형 콘텐츠이며 특정 종목의 매수·매도 권유가 아닙니다.