핵심 요약
AWS가 분산 학습 클러스터의 하드웨어 포트폴리오, 네트워크 아키텍처, 운영 전략까지 아우르는 컴퓨트 선택 가이드를 제시했습니다.
구현 방법
- 노드 내 8GPU(P5/P5en/P6) 구성을 위한 NVLink/NVSwitch와 노드 간 확장을 위한 EFA 인터커넥트 활용
- 데이터 파이프라인: S3→FSx Lustre 고속 읽기, 데이터 샤딩 및 prefetch로 GPU 공급 원활화
- 병렬화 전략: 데이터 병렬, 텐서 병렬, 파이프라인 병렬, MoE의 All-to-All 특성 고려 및 울트라서버의 NVLink 도메인 활용
- 운영/비용: 온디맨드 Capacity Block/ODCR, 스팟 인스턴스 고려, 자동 복구와 체크포인트 관리
주요 결과
- 통신 병목 제거와 비용-성능 균형을 위한 설계 방향 제시
- 운영 자동화(헬스 체크, 자동 재시작)가 대규모 학습의 안정성에 기여



