Moait
홈인기 피드모든 블로그모든 태그
홈인기 피드모든 블로그모든 태그
Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [1부: 콜드 스타트 최적화] 섬네일

Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [1부: 콜드 스타트 최적화]

AWS faviconAWS·DevOps·
AWSKubernetesPyTorchvLLMStreaming Loader
2026년 09월 10일1

AI 요약

이 글은 AI가 요약했어요. 정확한 내용은 꼭 원문을 확인해 주세요!

핵심 요약

AWS의 Gemma-4 서빙을 EKS에서 vLLM으로 운영해 4단계 콜드 스타트 분석을 통해 시작 시간을 428초에서 226초로 대폭 단축했고, 웜 재시작 및 유휴 상태에서의 복귀도 크게 개선했습니다.

구현 방법

  • 스트리밍 로더로 가중치를 S3에서 직접 로드하고 EKS Pod Identity로 파드를 인증
  • VLLM_CACHE_ROOT를 hostPath로 영속화해 재시작 시 캐시를 재사용
  • initContainer를 통한 S3 프리로드와 sleep 모드 도입

주요 결과

  • 가중치 로드 127.6초 → 19.8초(약 6.5배 빨라짐); 대역폭은 약 13.6Gbps
  • 콜드 스타트 428초 → 226초(이미지 프리 로드 포함)
  • 웜 재시작 314초 → 133초
  • wake 시간 0.97초로 즉시 복귀

연관 피드

%가 높을수록 이 글과 비슷할 가능성이 높아요!
Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [2부: GPU 한 장의 처리량과 지연 SLO] 섬네일
75%

Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [2부: GPU 한 장의 처리량과 지연 SLO]

AWS faviconAWS·2026년 09월 10일
No Image
75%

우리 팀만의 vLLM 플러그인 만들기 1편 - 검색 AI 모델 서빙 성능 극대화하기

NAVER D2 faviconNAVER D2·2026년 08월 10일
Amazon EKS에서vLLM Deep Learning Container를 사용하여LLM 배포하기 섬네일
72%

Amazon EKS에서vLLM Deep Learning Container를 사용하여LLM 배포하기

AWS faviconAWS·2025년 10월 27일