핵심 요약
AWS의 Amazon EKS에서 Gemma 4 31B를 vLLM으로 서빙하는 실험에서 GPU 한 장으로 대화형 SLO를 만족하면서 처리량을 크게 높이는 구성과 원칙이 제시됩니다.
구현 방법
- NVFP4 체크포인트와 vLLM v0.26.0 사용
- prefix caching, speculative decoding, max-num-seqs, gpu-memory-utilization 튜닝
- 대화형 vs 배치성 트래픽에 맞춘 풀 구성 제안
주요 결과
- NVFP4: 동시성 4에서 135.3 tok/s, 동시성 32에서 466.1 tok/s; BF16은 TTFT p99 829ms로 SLO 초과, NVFP4는 500ms 이내
- prefix caching으로 처리량 40% 증가, TTFT 약 2.1배 단축
![Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [2부: GPU 한 장의 처리량과 지연 SLO] 섬네일](https://d2908q01vomqb2.cloudfront.net/2a459380709e2fe4ac2dae5733c73225ff6cfee1/2026/09/09/thumbnail-2-1121x630.png)
![Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [1부: 콜드 스타트 최적화] 섬네일](https://d2908q01vomqb2.cloudfront.net/2a459380709e2fe4ac2dae5733c73225ff6cfee1/2026/09/09/thumbnail-1-1119x630.png)
