Moait
홈인기 피드모든 블로그모든 태그
홈인기 피드모든 블로그모든 태그
LLM 서빙, 띄우는 것과 잘 띄우는 것 사이 섬네일

LLM 서빙, 띄우는 것과 잘 띄우는 것 사이

토스 favicon토스·DevOps·
KubernetesvLLMGrafanaArgo CDSGLang
2026년 08월 21일0

AI 요약

이 글은 AI가 요약했어요. 정확한 내용은 꼭 원문을 확인해 주세요!

핵심 요약

토스는 LLM 서빙 생태계의 원인 파악과 안정성 강화를 위해 MLHub를 구축하고, 다중 지표 모니터링으로 TTFT를 약 20초에서 2초로 단축하며 에러율을 0.2%에서 0.02%로 감소시키는 성과를 거두었습니다.

구현 방법

  • MLHub로 로그/메트릭 정규화 및 단일 대시보드 구성
  • Grafana(메트릭)와 Kibana(로그)로 모니터링 이원화
  • vLLM/SGLang 지표 통합 및 Prefix/KV 캐시 최적화
  • 안정적 배포와 롤백 체계 마련

주요 결과

  • TTFT 20초 → 약 2초로 감소
  • Prefix Cache Hit Rate 90% 이상
  • 동시성 20까지 확장, 4배 트래픽 수용 가능
  • 다지표 기반 원인 파악으로 신속 대응 체계 구축

연관 피드

%가 높을수록 이 글과 비슷할 가능성이 높아요!
LLM을 이용한 서비스 취약점 분석 자동화 #1 섬네일
79%

LLM을 이용한 서비스 취약점 분석 자동화 #1

토스 favicon토스·2025년 12월 24일
AI에게 투자정보를 말하게 하기까지 섬네일
77%

AI에게 투자정보를 말하게 하기까지

토스 favicon토스·2026년 08월 13일
No Image
74%

우리 팀만의 vLLM 플러그인 만들기 1편 - 검색 AI 모델 서빙 성능 극대화하기

NAVER D2 faviconNAVER D2·2026년 08월 10일