핵심 요약
AWS의 울트라클러스터와 울트라서버를 통해 초대규모 분산 학습 아키텍처를 소개합니다. EFA SRD 기반 균일 대역폭 패브릭과 NVLink 도메인으로 수천~72GPU 단위의 병목 없이 AllReduce를 수행하고, FSx Lustre와 S3를 연결한 데이터 파이프라인으로 고속 데이터 공급을 보장합니다. ODCR/Capacity Block으로 인스턴스 용량을 미리 확보하는 전략도 설명합니다.
구현 방법
- 울트라클러스터: 수천 노드, folded Clos 패브릭, non-blocking full bisection, 노드당 3200 Gbps EFA 연결
- 울트라서버: NVLink 도메인 72GPU, 13.4 TB HBM3e, 360 PFLOPS
- 데이터 공급/오케스트레이션: FSx Lustre TB/s, S3 빠른 로딩, SageMaker HyperPod, AWS PCS, EKS
- 용량 확보: ODCR, Capacity Block의 차이와 운영 시나리오
주요 결과
- 균일 대역폭으로 노드 간 병목 제거, 대규모 학습 확장성 향상
- FSx/Lustre를 통한 데이터 공급으로 GPU 유휴 최소화
- ODCR/Capacity Block으로 예측 가능하고 비용 효율적 리소스 예약



