핵심 요약
NAVER D2는 vLLM 풀링 런타임으로 서빙 경로를 통합하고 IO Processor를 도입해 재순위화, ABSA, 이미지 랭킹의 처리량과 지연 시간을 대폭 개선했습니다. 재순위화 QPS는 63.85→397.21(6.2배), ABSA p50 101.22ms→16.43ms(83.8% 감소), 이미지 랭킹 3.76→62.2 img/s(16.5배 증가).
구현 방법
- vLLM 풀링 런타임 위에 다중 모델 서버를 공유 자산으로 운용하고 연속 배치를 활용
- IO Processor로 전처리/후처리를 단일 풀링 엔드포인트에서 처리
- 플러그인 패키지로 비즈니스 로직 분리 및 엔트리 포인트 자동 로딩
- 태스크: embed, classify, token_embed, token_classify
- 풀링 방식: CLS/LAST/MEAN/ALL/STEP
주요 결과
- 단일 엔드포인트에서 재순위화, ABSA, 이미지 랭킹 등 다중 모델 서빙 가능
- Hugging Face encode 대비 vLLM score 경로의 차이가 크게 나타남


