핵심 요약
AWS가 VLA와 RL 트랙으로 구성된 Physical AI 학습 파이프라인 구축 방법과 엣지 배포까지 포괄하는 워크숍형 기술 블로그를 소개합니다.
구현 방법
- VLA 트랙: GR00T N1.x를 SO-101 팔 데이터셋으로 미세조정하고 SageMaker Pipelines로 학습, 체크포인트를 S3에 저장하며 MLflow를 통한 실험 추적/모델 레지스트리에 등록합니다. 이후 워크스테이션에서 시뮬레이션 검증 및 AWS IoT Greengrass를 통한 엣지 배포를 수행합니다.
- RL 트랙: PPO로 Isaac Lab 및 MuJoCo에서 정책을 학습하고, SageMaker HyperPod 클러스터를 활용해 수일~수주 간 실험을 반복 수행합니다. 체크포인트는 FSx와 S3에 저장하고 Slurm/EKS로 운영합니다.
- 인프라/운영: 컨테이너 이미지를 CodeBuild로 빌드해 ECR에 저장하고, 공통 워크스테이션과 시뮬레이션 환경을 VPC로 연결합니다. 학습 데이터/체크포인트는 S3를 중심으로 관리하며, 엣지 배포는 Greengrass 컴포넌트로 자동화합니다. TensorRT 최적화로 엣지 추론 지연을 줄이고 DiT head 엔진을 활용합니다.
주요 결과
- 엣지 추론 지연 개선: GR00T N1.6에서 DiT head TensorRT 최적화로 L40S에서 126ms → 60ms, 약 2.1배 개선; Thor에서 156.3ms → 124.4ms, 약 1.26배 개선.
- RL 학습 확장성: Isaac Lab에서 2,048개 환경으로 72,000 타임스텝 학습 가능, 약 50분 소요, GPU 메모리 약 5GB 사용. 하이브리드 Slurm/EKS 기반 HyperPod으로 수일~수주 수준의 실험 유지 가능.



