Moait
홈인기 피드모든 블로그모든 태그
홈인기 피드모든 블로그모든 태그

우리 팀만의 vLLM 플러그인 만들기 1편 - 검색 AI 모델 서빙 성능 극대화하기

NAVER D2 faviconNAVER D2·Architecture·
Hugging FacevLLMRerankingCUDA GraphIO Processor
2026년 08월 10일0

AI 요약

이 글은 AI가 요약했어요. 정확한 내용은 꼭 원문을 확인해 주세요!

핵심 요약

NAVER D2는 vLLM 풀링 런타임으로 서빙 경로를 통합하고 IO Processor를 도입해 재순위화, ABSA, 이미지 랭킹의 처리량과 지연 시간을 대폭 개선했습니다. 재순위화 QPS는 63.85→397.21(6.2배), ABSA p50 101.22ms→16.43ms(83.8% 감소), 이미지 랭킹 3.76→62.2 img/s(16.5배 증가).

구현 방법

  • vLLM 풀링 런타임 위에 다중 모델 서버를 공유 자산으로 운용하고 연속 배치를 활용
  • IO Processor로 전처리/후처리를 단일 풀링 엔드포인트에서 처리
  • 플러그인 패키지로 비즈니스 로직 분리 및 엔트리 포인트 자동 로딩
  • 태스크: embed, classify, token_embed, token_classify
  • 풀링 방식: CLS/LAST/MEAN/ALL/STEP

주요 결과

  • 단일 엔드포인트에서 재순위화, ABSA, 이미지 랭킹 등 다중 모델 서빙 가능
  • Hugging Face encode 대비 vLLM score 경로의 차이가 크게 나타남

연관 피드

%가 높을수록 이 글과 비슷할 가능성이 높아요!
Amazon EC2 G5/G6 인스턴스에서 GPU Tensor Parallelism으로 비용 효과적으로 LLM 서빙하기 섬네일
78%

Amazon EC2 G5/G6 인스턴스에서 GPU Tensor Parallelism으로 비용 효과적으로 LLM 서빙하기

AWS faviconAWS·2026년 05월 26일
T4 GPU 1장으로 일궈낸 올리브영의 Gemma 3 기반 sLLM 구축기 섬네일
77%

T4 GPU 1장으로 일궈낸 올리브영의 Gemma 3 기반 sLLM 구축기

올리브영 favicon올리브영·2026년 01월 21일
온디바이스 AI 얼굴 식별 파이프라인 최적화 섬네일
76%

온디바이스 AI 얼굴 식별 파이프라인 최적화

하이퍼커넥트 favicon하이퍼커넥트·2026년 01월 23일