Moait
홈인기 피드모든 블로그모든 태그
홈인기 피드모든 블로그모든 태그
Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [2부: GPU 한 장의 처리량과 지연 SLO] 섬네일

Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [2부: GPU 한 장의 처리량과 지연 SLO]

AWS faviconAWS·AI/ML·
AWSKubernetesvLLMGemmaNVFP
2026년 09월 10일1

AI 요약

이 글은 AI가 요약했어요. 정확한 내용은 꼭 원문을 확인해 주세요!

핵심 요약

AWS의 Amazon EKS에서 Gemma 4 31B를 vLLM으로 서빙하는 실험에서 GPU 한 장으로 대화형 SLO를 만족하면서 처리량을 크게 높이는 구성과 원칙이 제시됩니다.

구현 방법

  • NVFP4 체크포인트와 vLLM v0.26.0 사용
  • prefix caching, speculative decoding, max-num-seqs, gpu-memory-utilization 튜닝
  • 대화형 vs 배치성 트래픽에 맞춘 풀 구성 제안

주요 결과

  • NVFP4: 동시성 4에서 135.3 tok/s, 동시성 32에서 466.1 tok/s; BF16은 TTFT p99 829ms로 SLO 초과, NVFP4는 500ms 이내
  • prefix caching으로 처리량 40% 증가, TTFT 약 2.1배 단축

연관 피드

%가 높을수록 이 글과 비슷할 가능성이 높아요!
Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [1부: 콜드 스타트 최적화] 섬네일
75%

Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [1부: 콜드 스타트 최적화]

AWS faviconAWS·2026년 09월 10일
No Image
74%

우리 팀만의 vLLM 플러그인 만들기 1편 - 검색 AI 모델 서빙 성능 극대화하기

NAVER D2 faviconNAVER D2·2026년 08월 10일
SageMaker AI로 해보는 GPT-OSS 추론 성능 테스트와 용량 산정 섬네일
74%

SageMaker AI로 해보는 GPT-OSS 추론 성능 테스트와 용량 산정

AWS faviconAWS·2025년 10월 24일