핵심 요약
AWS의 Gemma-4 서빙을 EKS에서 vLLM으로 운영해 4단계 콜드 스타트 분석을 통해 시작 시간을 428초에서 226초로 대폭 단축했고, 웜 재시작 및 유휴 상태에서의 복귀도 크게 개선했습니다.
구현 방법
- 스트리밍 로더로 가중치를 S3에서 직접 로드하고 EKS Pod Identity로 파드를 인증
- VLLM_CACHE_ROOT를 hostPath로 영속화해 재시작 시 캐시를 재사용
- initContainer를 통한 S3 프리로드와 sleep 모드 도입
주요 결과
- 가중치 로드 127.6초 → 19.8초(약 6.5배 빨라짐); 대역폭은 약 13.6Gbps
- 콜드 스타트 428초 → 226초(이미지 프리 로드 포함)
- 웜 재시작 314초 → 133초
- wake 시간 0.97초로 즉시 복귀
![Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [1부: 콜드 스타트 최적화] 섬네일](https://d2908q01vomqb2.cloudfront.net/2a459380709e2fe4ac2dae5733c73225ff6cfee1/2026/09/09/thumbnail-1-1119x630.png)
![Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [2부: GPU 한 장의 처리량과 지연 SLO] 섬네일](https://d2908q01vomqb2.cloudfront.net/2a459380709e2fe4ac2dae5733c73225ff6cfee1/2026/09/09/thumbnail-2-1121x630.png)
