핵심 요약
AWS의 Group Manager를 통해 UneeQ의 디지털 휴먼 렌더링 워크로드를 다중 리전에서 스팟 GPU 자원으로 자동 관리하고, 디지털 휴먼당 비용을 30~55% 절감했다.
구현 방법
- AWS Lambda와 2분 간격의 EventBridge 트리거로 그룹 매니저를 주기적으로 평가 및 조정
- 다중 리전 및 다양한 GPU 인스턴스 타입에 걸친 스팟 가용성과 가격을 평가하고 Auto Scaling 그룹 크기를 조정
- KEDA/HPA를 통해 쿠버네티스 배포의 파드 수를 가용 노드 용량에 맞춰 자동 조정
- 스팟 우선 전략으로 운영하고, 스팟 용량이 부족하면 안전망으로 온디맨드를 최소화하며, 가용 회복 시 신속 종료
- Route 53 지연 기반 라우팅과 ALB를 통한 다리 로드밸런싱 및 헬스 체크로 글로벌 트래픽 분산
- S3에 저장된 JSON 구성으로 인스턴스 타입 우선순위, 최대 가격, 파드 비율 등을 정의
주요 결과
- 디지털 휴먼당 비용 30~55% 절감
- 99.95% 가동 시간 달성을 위한 높은 복원력 확보
- 엔지니어 작업 시간 월간 약 15시간 절감
- 리전 간 자동 공급 배치를 통해 비용과 용량을 동시 최적화



